40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画
ArcFlow团队 投稿
量子位 | 公众号 QbitAI
在图像生成领域,“教师模型”生成的轨迹一般近似曲线,却往往要求“学生模型”必须走直线。
ArcFlow是复旦大学与微软亚洲研究院联合提出的图像生成加速方案。针对扩散模型推理耗时长、开销大的特点,ArcFlow并没有采用常见的线性简化策略,而是创新性地利用动量机制引入了非线性流,从而更精准地拟合复杂的生成轨迹。
这一改进使得模型在仅需2步(2 NFE)的情况下,依然能保持高度接近教师模型的画质。相比原始流程,ArcFlow实现了约40倍的推理加速和4倍的训练收敛加速;同时,该方法仅需微调极少比例的参数(<5%),训练收敛快,对显存资源也非常友好。
在AI绘画领域,Stable Diffusion 3、FLUX和Qwen-Image等大规模扩散模型已经能生成令人惊叹的图像。然而,高质量的背后是高昂的计算成本——它们通常需要40到100步的迭代去噪(NFE)才能完成从噪声到图像的转变。这让实时应用变得异常困难。
为了解决“慢”的问题,研究界提出了各种“蒸馏”(Distillation)技术,试图把几十步的推理压缩到几步(Few-step)。但这带来了一个新问题:画质劣化。
现有的蒸馏方法(如Progressive Distillation, Distribution Matching等)通常假设可以通过一条“直线路径”(Linear Shortcut)来连接噪声和最终图像。但实际上,教师模型(Teacher Model)的生成轨迹往往是复杂的曲线,其切线方向随时间不断变化。
这就好比老师在走一条蜿蜒的山路,而现有的加速方法强行让学生“走直线”抄近道。结果就是:几何失配(Geometric Mismatch)。学生模型无法在短短2-4步内拟合这种复杂的切线变化,导致生成的图像细节模糊、结构崩坏。
ArcFlow的核心解法:顺势而为的“非线性”
为了打破这一僵局,来自复旦大学和微软亚洲研究院的研究团队提出了ArcFlow。
ArcFlow的核心洞察非常直观:既然老师走的是曲线,那学生也应该学走曲线,而不是强行拉直。
具体来说,ArcFlow做了以下三大创新:
动量参数化:捕捉速度连续性,消除采样冗余
教师模型的去噪过程本质上是一个连续变化的物理过程,相邻时间步之间的速度方向并非独立,而是存在极强的相关性。传统的几十步采样之所以慢,是因为它忽略了这种连续性,反复地重新评估网络来遍历这个平滑的轨迹,导致了计算冗余。
ArcFlow敏锐地捕捉到了这一点。研究团队引入了物理学中的“动量”(Momentum)概念,将速度场建模为多个连续动量过程的混合。这就好比我们知道了物体的“初速度”和“惯性”,就能直接预判它后续的运动轨迹。通过参数化这种速度的演变规律,ArcFlow仅需一次计算,就能在时间轴上外推算出一条连贯的非线性路径,从而复现教师模型复杂的动态变化。
解析求解器:数学层面的“零误差”积分
既然用动量公式描述了速度如何随时间演变,ArcFlow可以推导出基于该公式的闭式解析解。这意味着,模型可以在单次前向传播中,直接通过数学公式计算出任意时间步的精确终端状态。这一设计彻底消除了传统少步生成的拟合误差,实现了高精度流匹配。
轨迹蒸馏策略:继承教师先验,拒绝“破坏性”学习
这是ArcFlow训练极快、参数极少的根本原因。
现有的线性蒸馏方法试图强行将教师弯曲的轨迹“拉直”,这本质上是在对抗教师模型预训练好的权重分布,迫使学生模型遗忘原有的生成先验去适应新的线性规则,因此往往需要全量微调且收敛缓慢。
相反,ArcFlow的非线性轨迹天然契合教师模型的生成模式。其蒸馏策略是在保留非线性特征的前提下,对瞬时速度进行对齐。这最大程度地保留了教师模型的预训练先验知识。因此,ArcFlow不需要破坏原有参数,仅需通过 LoRA微调极少量的适配层,即可快速继承教师的高质量生成能力,实现了训练效率与生成质量的双重飞跃。
实验效果
ArcFlow在Qwen-Image-20B和FLUX.1-dev等大规模模型上进行了验证,结果令人印象深刻:
极致速度:仅需2步(2 NFE)即可生成高质量图像,相比原始推理,加速了40倍。
参数高效:不像其他方法需要全量微调,ArcFlow仅需微调不到5%的参数(通过LoRA适配器),大大降低了训练门槛。
画质碾压:在Geneval、DPG-Bench等基准测试中,ArcFlow在2步推理下的FID(图像质量)和语义一致性均优于现有的SOTA方法(如pi-Flow, TwinFlow)。
快速收敛:得益于更精准的轨迹拟合,ArcFlow的训练收敛速度比基线方法快了4倍以上,仅需几千步训练就能达到高画质。
直观对比:
从论文展示的效果图来看,在同样的2步推理下,其他线性蒸馏方法生成的图像容易出现背景模糊、物体结构扭曲(如弯曲的剑、模糊的面部),尤其是在不同的初始噪声下,其他方法容易出现生成模式相似、多样性坍缩的情况。而ArcFlow生成的图像不仅清晰度高,而且保留了教师模型原本的丰富细节和画面多样性。
更多效果展示:
总结
本研究提出了ArcFlow,这是一种显式采用非线性轨迹来逼近预训练扩散教师模型复杂动态的少步蒸馏框架。通过将速度场参数化为连续动量过程的混合,ArcFlow获得了解析形式的闭式求解器,从而实现了精确的轨迹积分。
得益于其内在的非线性特性,ArcFlow确保了与教师模型的高精度对齐。此外,它避免了不稳定的对抗性目标函数和侵入式的全参数训练,从而实现了更快的收敛速度和更高效的蒸馏过程。
广泛的实验表明,与线性基线方法相比,ArcFlow在使用更少可训练参数的情况下,持续实现了更优的生成质量。作为一种创新性的知识蒸馏方案,它更高效地利用和继承了预训练教师模型的先验知识。这为未来的高效生成模型研究提供了一个极具潜力的方向。
(注:本文相关数据与图片引用自原始论文)
论文地址:
https://arxiv.org/abs/2602.09014
项目代码:
https://github.com/pnotp/ArcFlow
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
我们正在招聘一名眼疾手快、关注AI的学术编辑实习生🎓
🌟 点亮星标 🌟