视觉Token注入CLIP语义,走向多模态理解与生成新范式
腾讯ARC Lab 投稿
量子位 | 公众号 QbitAI
让视觉token说话,既能
看懂
图像,又可以
画出
图像!
TokLIP 的结构与核心设计
过去几年里,人工智能的发展已经从单一模态走向多模态,无论是图像、视频,还是文本,人们希望机器能够像人类一样,既能“看懂”世界,也能“说清”所见。 其中关键问题是: 如何在同一个模型中实现统一的理解 (comprehension) 与生成 (generation) 能力 。 目前的自回归多模态大模型对图像的编码大多依赖两类核心部件。 一类是 视觉编码器 (如CLIP) ,它擅长把图像转化为高层语义表征,从而实现跨模态对齐,但是难以支持视觉生成任务。 另一类是 视觉tokenizer (如VQ-VAE系列) ,它能把图像离散化成token,使其在形式上与文本一致,方便自回归Transformer联合建模。 比如 Emu3 和 Chameleon 采用了全模态离散化的方案,把图像、文本甚至其他模态统一转化为离散token,交给大语言模型直接处理,这种方法在形式上实现了统一,但缺点在于:离散token包含的信息大多为图像底层特征,导致语义信息不足,统一训练的代价高昂,多模态理解任务性能受限。 另一方面, VILA-U 等工作则强调通过离散化CLIP特征来增强视觉理解,但往往在语义对齐与底层重建的统一之间产生冲突,加大训练损失的优化难度,可能出现“理解强但生成弱”或者“生成顺畅但语义模糊”的问题。视觉Token语义化:让图像“能说话”
TokLIP的关键创新在于 引入CLIP的语义来对视觉token进行语义化处理 。 这意味着,图像被分解成的每一个离散token,不仅携带底层结构信息,还被注入了与语言对齐的高层语义信息。 因此后续的自回归模型不再面对“无意义的符号串”,而是直接处理带有语义标签的token,从而在跨模态对齐和任务泛化能力上都显著提升。 换句话说,TokLIP让视觉token不再只是“图像的残片”,而是变成了“会说话的语义单元”。TokLIP框架与训练流程
在模型架构上,TokLIP采用了 视觉tokenizer 与 ViT-based token encoder 相结合的方式,并通过语义监督损失学习图像高层特征。- 不需要专门的重构损失来保证token的可逆性,避免了重构损失和语义监督的训练冲突,降低了训练复杂度;
- Freeze VQGAN的设计保留了生成能力和框架的灵活替换性,模型能够在训练过程中自适应地调整token的语义表达,使其既保留图像细节,又兼顾语义对齐;
- 继承预训练的CLIP权重,在相同算力资源下能够更快收敛,整个pipeline更加简洁高效,并取得更优的性能。
实验效果
TokLIP基于预训练VQGAN,提供三种版本: TokLIP-B (256×256,VQGAN来自LlamaGen) ; TokLIP-L (384×384,同样来自LlamaGen) ; TokLIP-XL (512×512,采用IBQ,26万codebook) 。 所有模型都使用16倍下采样,encoder初始化自SigLIP2,并通过两层MLP将VQGAN特征映射到语义空间,训练数据涵盖CapsFusion、CC12M、LAION-high-resolution,其中TokLIP-B额外加入LAION400M子集。图像分类与图文检索任务
在图像分类与跨模态检索中, TokLIP超越了VILA-U、QLIP等离散语义方法,并超过了部分连续的视觉编码器 ,证明语义化VQ token的有效性。 更重要的是,TokLIP所需训练数据远少于同类方案,却依然取得领先性能,展现出一种 轻量而高效 的解决路径。多模态理解任务
当TokLIP被接入多模态大语言模型 (MLLM) 时,其语义token能无缝嵌入现有的语言建模框架。 实验中,研究人员在常用的 7个下游任务 上进行了评估,结果表明:TokLIP在离散化方案中取得了很有竞争力的结构,证明了TokLIP能够提供带有语义信息的输入,使得MLLM在问答与推理时更加准确。自回归图像生成任务
在自回归生成 (AR Generation) 任务上,TokLIP的语义化token在这一环节提供了语义信息,实验表明,TokLIP比仅使用VQGAN在不同训练设置下都取得了更低的FID效果,证明了语义信息可以帮助生成任务。代码链接:https://github.com/TencentARC/TokLIP
模型权重:https://huggingface.co/TencentARC/TokLIP 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 —