Diff2Flow:基于扩散模型对齐的训练流匹配模型)
论文题目Diff2Flow: Training Flow Matching Models via Diffusion Model AlignmentDiff2Flow基于扩散模型对齐的训练流匹配模型会议CVPR2025摘要扩散模型通过高保真输出彻底改变了生成性任务而流匹配(FM)提供了更快的推理和经验性能收益。然而当前的基础FM模型在计算上限制了精调而像稳定扩散这样的扩散模型受益于高效的体系结构和生态系统支持。这项工作解决了有效地将知识从预先训练的扩散模型转移到流匹配的关键挑战。我们提出了Diff2Flow这是一个新的框架通过重新调整时间步长对齐内插值并从扩散预测中获得与FM兼容的速度场系统地连接了扩散和FM范例。这种对齐实现了扩散先验的直接和高效的FM微调而不需要额外的计算开销。我们的实验表明Diff2Flow的性能优于NAıve FM和扩散微调特别是在参数高效的约束下同时与最先进的方法相比在不同的下游任务中获得了更好或更具竞争力的性能。我们将在https://github.上发布我们的代码Com/CompVis/Diff2flow。Diff2Flow如何用扩散模型的遗产高效训练流匹配模型一、背景与动机两个范式之间的鸿沟近年来生成式图像模型领域出现了两条并行的技术路线扩散模型Diffusion Models, DM以 Stable Diffusion 为代表凭借高保真度的输出和成熟的生态系统微调工具、社区资源、高效架构成为实际部署中的首选。流匹配模型Flow Matching, FM则是更新的范式理论上具有更直的概率路径在推理速度和生成质量上均有实测优势。当前最先进的 FM 基础模型如 Flux、Stable Diffusion v3参数量均超过 8B高端硬件才能运行微调几乎不可行。这就带来了一个核心矛盾FM 更好用但贵DM 更成熟但已是旧范式。能不能把 Stable Diffusion 这类预训练扩散模型的知识迁移到 FM同时保留 FM 的推理优势这正是本文要解决的问题。二、问题的根源三重错位看起来直接把 FM 的训练目标最小化速度场误差套在预训练的扩散模型上微调就行了——但实验证明这样做效果极差尤其在参数高效微调LoRA场景下几乎完全失效。原因在于两个范式之间存在三重本质性错位错位一插值方式不同扩散模型的前向过程插值是非线性的由噪声调度参数决定而流匹配的插值是线性的错位二时间步缩放不同扩散模型的时间步是离散整数而流匹配使用连续实数。两者边界条件含义也相反扩散模型 t0 是干净图像tT 是纯噪声流匹配恰好相反t1 是数据t0 是噪声。错位三训练目标参数化不同扩散模型的网络预测的是噪声-参数化或速度-参数化而流匹配的网络直接预测速度场即。两者输出的语义完全不同。三、Diff2Flow 方法三步系统对齐【论文Figure 1Diff2Flow 轨迹对齐示意图展示扩散轨迹与流匹配轨迹的对应关系以及速度预测的推导过程】我们引入了一种新的精调技术来在流匹配和扩散之间进行遍历该技术能够以最少的额外训练有效地对齐这两个过程。流匹配轨迹上的内插值被计算为扩散时间步长t、样本x和相关扩散系数的函数f。我们的方法进一步实现了速度预测而不考虑扩散模型的参数化。Diff2Flow 的核心思想是不强迫模型忘记旧的参数化而是建立一套数学映射把扩散轨迹上的预测翻译为流匹配轨迹上的速度场再用 FM 损失微调。整个框架由三个步骤组成。步骤一时间步重缩放Timestep Rescaling定义一个可逆的双向映射将扩散时间步映射到流匹配时间步这个公式非常自然当干净图像时对应 FM 的数据端当纯噪声时对应 FM 的噪声端。边界条件完美对齐。由于扩散模型的只在离散整数时间步定义而 FM 需要连续时间步论文在离散点之间做分段线性插值并发现了一个有趣的现象【论文Figure 2对比正常整数时间步与平移后非整数时间步的生成结果说明扩散模型对非训练过的连续时间步依然鲁棒】尽管扩散模型从未在非整数时间步上训练直接以为输入的生成质量依然良好。论文推测正弦位置编码天然构建了连续时间空间。这一发现为轨迹插值奠定了实验基础。步骤二插值对齐Interpolant Alignment为了把非线性扩散轨迹上的样本变换为流匹配线性轨迹上的等价点定义空间变换这是一个简单的缩放操作无需任何额外计算。可以验证变换后的插值恰好满足流匹配的线性插值形式。逆变换FM → DM为步骤三目标函数统一Objective Unification有了上述两个映射就可以从扩散模型的预测v-参数化直接推导出 FM 所需的速度场。设为预训练扩散模型的 v-预测输出则对应的 FM 速度场为这个推导无需改变模型的输出头也无需额外的计算图。同样的方法可以推广到-参数化的扩散模型。完整算法流程训练阶段Algorithm 1给定 FM 时间步、噪声和数据按 FM 插值公式计算用将映射回用将映射回用扩散模型在处做前向推断得到速度估计用 FM 损失函数对做梯度下降推理阶段Algorithm 2每一步 Euler 积分均先将 FM 时间步映射到 DM 时间步再映射 FM 样本到 DM 轨迹获取速度预测最后按 FM 的 Euler 更新公式前进。与 LoRA 的协同论文发现LoRA 在朴素 FM 微调下几乎完全失效模型需要从扩散参数化切换到速度场预测这需要大范围更新权重低秩更新根本无法承载如此剧烈的变化。而在 Diff2Flow 的对齐框架下模型无需改变参数化方式LoRA 只需聚焦于任务本身如学习深度特征效果大幅改善。四、实验四类任务全面验证4.1 文本生成图像Text-to-Image实验基于 Stable Diffusion 2.1768×768 预训练在 LAION-Aesthetics 数据集上微调至 512×512 分辨率在 COCO 2017 上评估。【论文Figure 5COCO 2017 FID 收敛曲线左图为全参数微调右图为 LoRA 微调对比 DM、FM、Diff2Flow 三种方法的收敛速度与最终性能】关键观察全参数微调下FM 和 Diff2Flow 最终收敛到相近性能但 Diff2Flow 收敛显著更快约 2.5k 步即可达到 FM 需要更多步才能达到的性能因为模型无需从头学习如何输出速度场LoRA 微调下差距更加显著朴素 FM 微调的 LoRA 无法跟上 Diff2Flow说明参数量受限时对齐的重要性大幅提升【论文Table 1COCO-2017 5k 量化对比表包含 FID↓、CLIP↑、Aesthetics Score↑ 三个指标Diff2Flow 均优于 SD1.5 基线和持续扩散训练】Diff2Flow 取得 FID52.80CLIP26.54美学分5.99全面超越 SD1.5 基线56.77/26.34/5.32附加收益——解决非零终端 SNR 问题扩散模型存在一个已知缺陷由于噪声调度的零终端 SNR 问题模型无法生成真正的纯黑或纯白图像平均色调会偏灰。Diff2Flow 的线性 FM 轨迹天然没有此问题。【论文Figure 4对比 DM、FM、Diff2Flow 对纯白图像和白底灰圆提示词的生成结果展示 Diff2Flow含/不含 LoRA能正确生成无灰偏的图像而 DM 版本明显偏灰】【论文Figure 3定性对比图展示 DM/FM/Diff2Flow 在相同种子、相同采样步数下的生成质量包含两个提示词示例宇航员/猫油画可直观感受视觉质量差异】4.2 轨迹矫正ReflowReflow 是一种通过将噪声-图像对与 ODE 轨迹对齐来拉直流匹配采样路径的技术能大幅减少推理所需步数。本文将 Diff2Flow 与 Reflow 结合在 Stable Diffusion v1.5 上仅微调 LoRA62M 参数不到全参数的 7%。【论文Table 3Reflow 对比表各方法在 25/4/2 步推理下的 FID↓ 和 CLIP↑Diff2Flow(LoRA) 与全参数的 Rectified Flow 相比有竞争力】核心数据25 步推理Diff2Flow(LoRA) FID21.45接近 Rectified Flow 全参数0.9B的 21.654 步推理FID25.29CLIP0.313超过 PeRFlow 全参数的 CLIP0.2942 步推理FID32.31CLIP0.305优于 Rectified Flow 全参数的 CLIP0.296仅用 62M 参数就达到与 900M 参数模型竞争的速度-质量权衡充分说明对齐的重要性。【论文Figure 6SD1.5 Diff2Flow-Reflow 的 4 步推理定性结果展示图】4.3 单目深度估计Monocular Depth Estimation这是验证 Diff2Flow 跨任务泛化能力的核心实验。实验设置与 Marigold 和 DepthFM 相同在合成图像-深度图数据上74K 样本微调在 5 个真实世界数据集上做零样本评估。【论文Table 2主要对比表包含 NYUv2/KITTI/ETH3D/ScanNet/DIODE 五个数据集的 AbsRel↓ 和 δ₁↑对比判别式方法DAv1/2、Metric3D、Metric3Dv2和生成式方法Marigold、GeoWizard、DepthFM、E2E-FT、Lotus-G、Diff2Flow】重点对比数据方法NYUv2 AbsRel↓KITTI AbsRel↓ETH3D AbsRel↓DepthFM74K6.09.16.5Marigold74K5.59.96.5Diff2Flow74K5.78.75.5最优Diff2Flow(LoRA)74K5.99.56.0Diff2Flow 在 KITTI 和 ETH3D 上超过 DepthFM需要指出DepthFM 直接用 FM 目标微调存在三重错位ETH3D 的 AbsRel5.5 是所有生成式方法中最优LoRA 版本仅用 222M 参数在 NYUv2 上达到 AbsRel5.9接近全参数 DepthFM6.0【论文Figure 8NYUv2 收敛曲线左图全参数微调右图 LoRA 微调横轴为训练迭代数纵轴为 δ₁-Accuracy展示 Diff2Flow 在极少训练步后即可超越 DM在 LoRA 场景下优势更大】【论文Figure 7真实世界图像的定性深度预测对比展示 DAv1/DAv2/Marigold/E2E-FT/DepthFM/Diff2Flow(LoRA)/Diff2Flow(Full FT) 七种方法的预测结果Diff2Flow 在细节保留上更为突出】4.4 参数量消融Ablation on Trainable Parameters【论文Table 4NYUv2 零样本评估对比不同可训练参数量866M全参/222M LoRA-base/62M LoRA-small的 AbsRel↓ 和 δ₁↑同时与 MarigoldE2E-FT866M对比】关键结论仅用约 1/4 的参数222M vs 866MDiff2Flow 就能与全参数的 E2E-FT 方法竞争AbsRel: 5.9 vs 5.2即便进一步压缩到 62M也能达到 AbsRel6.9仍有实用价值。五、方法对比Diff2Flow vs 朴素FM微调 vs 持续扩散训练对比维度持续扩散训练DM朴素 FM 微调Diff2Flow本文推理速度慢弯曲轨迹快直线轨迹快直线轨迹收敛速度快慢需重学参数化快对齐后无需重学LoRA 兼容性好极差好终端SNR问题有无无额外计算开销无无无Reflow 兼容否是是六、核心洞察与总结Diff2Flow 最本质的贡献是揭示了扩散模型和流匹配模型之间存在一套精确的数学对应关系——通过时间步缩放、插值变换、目标函数推导可以将一个扩散模型的任意中间状态精确映射到流匹配轨迹上从而让两个框架的训练目标在数学上完全一致。这意味着迁移代价极低无额外计算无架构修改只需调整损失函数的计算方式LoRA 得以解锁对齐后的框架中模型不需要切换范式低秩更新得以聚焦于真正的任务学习广泛适用性对-参数化和 v-参数化均有效对文本生成图像、深度估计、轨迹矫正等不同任务均有效对于有大量 Stable Diffusion 生态积累微调权重、数据集、基础设施的研究者和工程师而言Diff2Flow 提供了一条低成本升级到流匹配范式的实用路径而无需重新依赖数十亿参数的 FM 基础模型。七、局限性与未来方向论文本身未详细讨论局限性但从实验结果可以观察到LoRA-small62M在某些任务上仍与全参数方法有差距说明参数量仍然是上限实验基于 Stable Diffusion v1.5/v2.1对更大规模扩散模型如 SDXL的迁移效果尚待验证本文未覆盖视频生成等序列建模场景未来可探索的方向包括将 Diff2Flow 与一致性蒸馏Consistency Distillation结合或用于视频扩散模型到视频流匹配模型的迁移。