量子位

从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026

非羊 整理自 凹非寺 
量子位 | 公众号 QbitAI

Image

△ 首个 visual prior unified discrete diffusion model,用一套离散扩散框架同时打通文生图、图生文和VQA

AI大模型,可能正在悄悄换基座。

过去几年,整个行业最熟悉、也最成功的预训练范式,几乎都围绕同一个问题展开:预测下一个词。

从GPT到后来的各种视觉语言模型,主流思路都很一致——先把语言这套体系做强,再让视觉、音频、动作等模态逐步接入。语言是骨架,其他模态更像外挂。

这条路线太成功了,以至于很多人默认:多模态统一模型,理应继续沿着这条路往前走。

但现在,这个前提开始松动了。

不久前,NVIDIA研究员Jim Fan提出一个很有代表性的判断:AI正在经历第二次预训练范式转移。第一次是next word prediction,第二次则是world modeling,也就是“预测下一个物理状态”。在这个视角下,模型学习的不再只是token与token的接续关系,而是世界在给定条件和动作之后,会如何继续演化。

Image

这个判断真正重要的地方,不只是机器人、视频生成和具身智能,而是它逼着多模态领域重新回答一个更底层的问题:

如果未来的基础模型要更接近世界本身,它还应该继续建立在语言优先的体系上吗?

Muddit给出的答案是:未必。

多模态统一模型很多,但“真统一”其实很少

Image

这两年,统一生成模型一直是热门方向。

从早期把视觉接进LLM的方案,到后来更进一步把图像理解、图像生成、文本生成、视觉问答放进同一个系统里,整个领域都在追求“一个模型做所有事”。但如果仔细看这些路线,会发现其中绝大多数统一模型,本质上依然是language-first的。

也就是说,系统真正的中心仍然是语言模型。视觉先经过编码器压缩,再送进语言骨干;图像生成能力则通过模板、special token,或者一个额外模块去接出来。看上去是统一,实际上更像是“围绕语言主干的能力拼装”。

这条路当然有它的合理性。

一方面,LLM的scaling law、训练recipe、数据组织方式和benchmark体系,行业已经摸得非常熟;另一方面,语言本身就是很高效的抽象接口,天然适合承载指令、知识和推理。

但问题也恰恰在这里。

对于图像来说,语言那套“从左到右、一个token接一个token”地顺序生成,并不是最自然的表达方式。图像本质上是二维结构,有空间关系、有局部一致性、有大量并行依赖,而自回归建模却硬是把它压扁成一串raster-order token。结果就是:图像生成天然更慢,推理成本更高,也更难兼顾质量、效率和可控性。

更关键的是,很多所谓统一模型,其实并没有真正统一生成原理。

文本是一套机制,图像是另一套机制,中间再靠模板、额外token或多阶段pipeline把它们勉强缝在一起。还有一些diffusion路线,虽然看起来更像统一,但文本和图像依然可能分别采用离散扩散和连续扩散两套建模逻辑。这样的系统可以工作,但很难说它已经形成了一种真正统一的多模态生成范式。

Muddit想解决的,正是这个问题。

不是让LLM会画图,而是让图像模型学会统一生成

与其说Muddit是“又一个unified model”,不如说它在试图把统一模型的底层逻辑整个翻过来。

Image

过去很多方法的思路是:

让LLM学会看图、画图。

而Muddit的思路是:

让一个强视觉先验的图像生成模型,真正长出跨模态统一生成能力。

这也是它最核心的判断:统一模型,不一定非得建立在language prior之上,也可以建立在visual prior之上。

换句话说,Muddit不是把图像能力接到语言系统后面,而是从一个已经具备强图像生成能力的模型出发,再去统一图像与文本的生成过程。它真正想挑战的,是多模态领域默认已久的“语言中心论”。

这背后其实对应着两种完全不同的系统哲学。

语言先验更擅长组织知识、压缩语义、承载指令;视觉先验则更接近空间结构、外观分布、组合关系,以及真实世界的呈现方式。前者更像“解释世界”的接口,后者更像“贴近世界”的表征。

如果未来的多模态基础模型要进一步走向更强的生成、理解、预测,甚至更长远地走向world modeling,那么问题就不再只是“这个东西叫什么”,而会越来越多地变成“这个世界长什么样”“这些对象如何组合”“状态如何变化”“给定条件下结果会如何展开”。

从这个角度看,Muddit的价值并不只是多做了几个任务,而是把统一模型的起点,从语言先验重新挪向了视觉先验。

一套fully discrete diffusion,直接打通三类任务

Image

在范式设计上,Muddit走的是一条相当干脆的路线:fully discrete diffusion。

它把文本和图像都表示成离散token,然后用同一个离散扩散框架去建模。最终,文生图、图生文和视觉问答三类任务,共享的是同一个生成器、同一套训练目标,以及同一种迭代采样逻辑。

这件事的关键,不只是“一个模型做三件事”,而是:三件事终于共享了同一种生成语法。

Muddit的核心backbone是一个共享的MM-DiT。它并不是从零训练,而是直接由预训练的Meissonic文生图模型初始化,把高质量文本到图像建模里已经学到的空间结构、语义对应和视觉细节能力,直接带进统一生成框架里。与此同时,模型又增加了一个轻量级文本解码头,把离散token空间里的结果映射回文本输出。

这使得整个系统的结构非常统一:

对于文生图,模型从全mask的图像token出发,在文本条件下逐步还原图像;

对于图生文,模型从全mask的文本token出发,在图像条件下迭代生成描述;

对于VQA,则把图像和问题一起作为条件,让模型在同一套扩散式解码流程里生成答案。

也就是说,任务切换并不意味着模型内部换一套机制。真正变化的,只是条件信号;扩散过程、loss设计和guidance逻辑,都是共享的。

这也是Muddit想强调的一点:它追求的不是“多任务共存”,而是生成机制层面的统一。

为什么离散扩散适合做这件事?

过去几年,扩散模型在图像生成上已经被证明有效;而在文本侧,离散扩散也逐渐被重新重视。Muddit的一个关键出发点,就是把两者真正放到同一个离散空间里讨论。

相比自回归方法,离散扩散的优势在于它不是死守某个固定生成顺序,而是通过随机masking和逐步恢复,让模型学习“在任意部分可见的上下文下,如何恢复剩余token”。这意味着它不需要把图像硬压成严格的一维顺序,也天然支持并行预测多个位置,推理更灵活。

Muddit采用的是吸收态mask扩散。训练时,模型会随机对文本或图像token进行masking,并学习在给定条件下恢复被遮住的token;推理时,则从全mask序列开始,一步步反向恢复。因为文本和图像在这个框架里共享同一种corruption schedule和objective,统一建模才真正成立。

这样做的意义很直接:统一,不再只是系统工程意义上的统一,而是概率建模层面的统一。

结果能不能打,最后还是看benchmark

路线是否成立,最终还是要回到结果上。

Image

在文生图上,Muddit的512×512、1B参数模型在GenEval上取得了0.61的overall accuracy,超过Monetico的0.44和Meissonic的0.54,接近2B的Stable Diffusion 3的0.62。更具体地看,它在two objects上达到0.72,在counting上达到0.54,说明它不仅仅是“能生成”,在组合性和结构性要求更强的prompt上也具备相当竞争力。

Image

在图像理解与图生文上,Muddit同样没有掉队。1B的512×512模型在MS-COCO captioning上达到59.9 CIDEr;在VQAv2上达到68.2%;MME为1107.4,GQA为57.5,MMMU为27.6。到了1024×1024版本,这些指标进一步提高到60.1、70.2%、1139.2、57.8和28.7。

这组结果最有意思的地方,不只是“分数不错”,而是它来自一个fully discrete diffusion + visual prior的统一框架。也就是说,Muddit证明了一件此前并不被默认成立的事:只要底层先验足够强,纯离散扩散并不是只能做一个“理论上优雅、实际不够强”的统一模型,它完全有能力在统一生成和统一理解上做出竞争力。

论文里几个很值得关注的细节

此外,论文的消融显示,如果只做text-to-image,GenEval是59.3;如果只做image-to-text,GenEval会直接掉到28.3;而joint training可以把它拉到61.6。这个结果很说明问题:统一训练并不是为了好看,而是真能让跨模态对齐能力长出来。图像生成能力和图像理解能力并不是相互独立的,两者放在一起联合优化,反而能让模型对“图文之间到底如何对应”学得更稳。

更重要的一点是,它用更少的数据,做到了不差的统一效果。在论文的scalability部分,Muddit还做了一个很重要的比较。作者将扩展后的Muddit与一批统一模型进行对比,包括同尺寸的混合架构模型,以及当时较强的统一离散扩散模型。结果显示,Muddit在图像生成和图像理解多个benchmark上都保持了稳定竞争力,而且一个非常突出的特点是:它使用的数据规模并不夸张。

论文里给出的对比显示,1B的Muddit 512×512版本基于10M数据,1024×1024版本基于16M数据;而一些对比工作使用的数据量则明显更大。作者对此给出的解释也很有代表性:一方面,visual prior本身已经带来了很强的图文对齐能力;另一方面,fully unified的建模范式避免了混合目标、额外special token和复杂架构带来的优化负担。

这其实点出了一个被很多人忽略的问题:统一模型不只是“参数够不够大”,也不只是“数据够不够多”,底层prior和建模范式本身会直接决定训练效率。这个效率上的分析在Muddit前作Meissonic中也有讨论。

Image

这件事为什么值得在2026年被认真看待?

如果把Muddit放回更大的时间线上看,它的意义就不只是“做了一个能文生图、能图生文、还能VQA的模型”。

它真正切中的,是多模态基础模型接下来很可能要面对的一次方向切换。

过去的多模态统一,大多还是在语言体系里扩展视觉;未来的多模态统一,可能会反过来,要求模型更接近世界结构本身。视频、3D、交互式agent、具身智能、world modeling,这些方向的共同点在于:模型处理的核心对象不再只是词,而是状态、空间、变化和反馈。

而这些东西,天然更靠近视觉,而不是语言。

Image

从这个意义上说,Muddit当然还不是一个完整意义上的world model,它也不等于机器人里的action-conditioned future prediction。但它确实踩在了MeissonFlow Research提到的演化路径上:

让统一模型开始从language-first,转向vision-first。

这也是为什么它看上去是在讨论文生图、图生文和VQA,真正触及的却是更底层的问题:

统一生成模型,到底应该建立在什么样的prior之上?

Muddit的回答很清楚:

不是从语言出发,让视觉来适配;

而是从视觉出发,让统一生成真正成立。

在“下一个预训练范式”已经开始浮现的今天,这个答案,可能比很多人想象中更重要。

结语

今天,很多人仍然默认:多模态的未来,就是把LLM做得更大,再把视觉、视频、动作、3D一层层接进去。

但Muddit提出了另一种可能。

如果视觉本身就承载着更接近世界结构的先验,如果图像生成模型已经学到了丰富的空间、语义和组合知识,那么下一代统一模型,为什么一定要从语言出发?为什么不能反过来,从视觉出发,重新搭建文本与图像的共同生成框架?

这并不是一句口号,而是一个已经被训练出来、被benchmark检验过的具体系统。

也许,统一生成的下一站,真的不该再只是“让LLM多会一点”。

而是要重新思考:什么才应该是多模态基础模型真正的基座。

论文标题:
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
论文链接:
https://arxiv.org/abs/2505.23606
相关项目:
https://github.com/M-E-AGI-Lab/Muddit

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

我们正在招聘一名眼疾手快、关注AI的学术编辑实习生🎓

感兴趣的小伙伴欢迎关注 👉 了解详情

Image

🌟 点亮星标 🌟

科技前沿进展每日见