自回归超越扩散!北大、字节 VAR 范式解锁视觉生成 Scaling Law
体验网站:https://var.vision/ 论文链接:https://arxiv.org/abs/2404.02905 开源代码:https://github.com/FoundationVision/VAR 开源模型:https://huggingface.co/FoundationVision/var
背景介绍
VAR方法核心:模仿人类视觉,重新定义图像自回归顺序
VAR方法细节:两阶段训练
离散编码:编码器将图片转化为离散 token map R=(r1, r2, ..., rk),分辨率从小到大
连续化:r1至rk先通过嵌入层转换为连续 feature map,再统一插值到rk对应最大分辨率,并求和
连续解码:求和后的 feature map 经过解码器得到重建图片,并通过重建+感知+对抗三个损失混合训练
自回归第一步是通过起始token [S] 预测最初的 1x1 token map
随后每一步,VAR都基于历史所有的 token map 去预测下一个更大尺度的 token map
训练阶段,VAR 使用标准的交叉熵损失监督这些 token map 的概率预测
测试阶段,采样得到的 token map 会借助 VQVAE decoder 进行连续化、插值求和、解码,从而得到最终生成的图像
实验效果对比
VAR 大幅提升了 AR 的效果,一转 AR 落后于 Diffusion 的局面
VAR 仅需 10 步自回归步骤,生成速度大幅超过AR、Diffusion,甚至逼近 GAN 的高效率
通过 Scale up VAR 直至 2B/3B,VAR 达到了 SOTA 水平,展现出一个全新的、有潜力的生成模型家族。
更好效果:经过 scale up,VAR最终达到 FID=1.80,逼近理论上的 FID 下限 1.78(ImageNet validation set),显著优于 DiT最优的 2.10
更快速度:VAR只需不到0.3秒即可生成一张256图像,速度是DiT的45倍;在512上更是DiT的81倍
更好 Scaling 能力:如左图所示,DiT 大模型在增长至 3B、7B 后体现出饱和现象,无法更靠近 FID 下限;而 VAR 经过缩放到20亿参数,性能不断提升,最终触及 FID 下限
更高效的数据利用:VAR仅需350 epoch训练即超过 DiT 1400 epoch 训练