小红书技术REDtech

小红书 dots 团队提出 Vision-OPD,让多模态大模型“看清细节”!

Image

多模态大模型(Multimodal LLM)如今在通用看图说话上已经相当能打,但只要问题的答案藏在图里一小块决定性的细节上,它们就常常给出一个错误的回答。

举个例子:

“图中人物戴的护耳是什么颜色?”

Image

这道题人盯着完整大图也未必能一眼答对——那块护耳藏在画面的一小块区域,不凑近看根本分辨不清颜色。当下顶尖的多模态大模型同样频频翻车:给它完整大图,它信誓旦旦答“黑色”,而正确答案其实是“绿色”。

为突破这一瓶颈,小红书 dots团队提出了Vision-OPD(Vision On-Policy Distillation)。仅用约 6.2K 条全自动合成数据,便让 9B 模型在多个细粒度视觉理解基准上取得 SOTA,超越 Gemini-3.5-Flash、Gemini-3.1-Pro 和 GPT-5.4 等顶尖闭源模型。

Image

论文标题:

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

论文链接:

https://arxiv.org/abs/2605.18740

代码链接:

https://github.com/VisionOPD/Vision-OPD

Image

在V* Bench、ZoomBench、HR-Bench 4K、HR-Bench 8K、MME-RealWorld-EN、MME-RealWorld-CN 六个细粒度视觉理解基准上的平均准确率(%)。Vision-OPD-9B 以 79.7 总体第一,Vision-OPD-4B 也达 77.1。

Image

模型为什么会在这种细节题上翻车?有一个有意思的现象:同一个模型,看裁剪放大后的局部图,回答细粒度问题的准确率,明显高于看完整大图。 这道坎叫作 「区域到全局鸿沟」。

还是以前面那道题为例(基于 Qwen3.5-9B):

  • 给完整大图:模型被全局场景带偏,答“黑色”——错;

  • 只给裁剪放大后的关键区域:决定性证据被凸显出来,模型答“绿色”——对。

Image

这并不是个例。系统评测显示,区域输入的准确率持续高于全局输入约 18~22 个百分点,即便是体量大得多的开源模型和闭源模型(GLM-4.6V、GPT-5.4、Gemini-3.1-Pro),也都表现出同样显著的差距。

Image

这说明一个关键事实:单纯堆参数规模,并不能弥合这道鸿沟。模型的细粒度瓶颈,往往不在“认不认得出”,而在“盯不盯得住”。

那要怎么弥合这道鸿沟?最近流行的"Thinking-with-Images"(边想边看)方法给模型配上裁剪、放大的视觉工具,让它在推理时主动去抠局部,确实有效——但代价是反复编码图像、反复调用模型,推理开销大幅增加。

于是问题来了:

能不能把“放大关键区域、让证据从背景里凸显出来”这个好处,通过训练直接内化进模型,让它一次前向就能从整图里用上细粒度证据,而不必在推理时动用任何工具?

Image

既然模型看局部一向比看全局强,那么它看裁剪图时的表现,就是一份现成的、可以拿来提升全图表现的特权监督信号——用前者去教后者,把“放大”的收益内化成单次前向的能力。

由此,团队提出Vision-OPD,一个面向细粒度视觉理解的区域到全局在线自蒸馏框架。

2.1 训练框架

它的精髓在于,从同一个模型里派生出两个“视角不同”的策略:

  • 裁剪教师(Teacher):只看那块对准了关键证据的裁剪放大图,这是它的特权视角;

  • 全图学生(Student):看完整大图。

Image

学生先在全图上自己生成回答轨迹(在线采样);对学生写下的每一段前缀,Vision-OPD 分别算出裁剪教师和全图学生的 logits 分布,再把两者的散度压到最小。这样一来,模型就在学生自己的生成轨迹上,把教师的裁剪特权行为迁移给了全图策略——不用外部教师、不用真值标签、不用奖励验证器、推理时也不用任何工具。

这套“在线采样 + token 级蒸馏”的组合,好处有两层:

  • 在线采样:训练前缀就是学生自己写出来的序列,训练和推理的状态分布对得上,避开了传统离线蒸馏里“前缀对不上、误差越滚越大”的毛病;

  • 稠密 token 级监督:每个 token 都拿到有意义的梯度,不像 GRPO 这类强化学习只有稀疏的序列级奖励,哪怕一批采样样本恰好全对或全错,训练也不会停摆。

2.2 数据合成

数据从哪来?团队用一条全自动流水线,从无标注图像里造出三元组 `(全图、裁剪图、问题)`,总共合成约 6.2K条:

  1. 对原图做物体识别和分割,挑出面积占比很小(最可能藏着细粒度证据)的区域;

  2. 让模型给每个区域生成一个“光看这块就能答”的问题;

  3. 把区域的边界框叠回原图,再加一句空间约束(比如“只关注红框里的物体”),得到学生输入;

  4. 把这块区域裁剪、放大2×,得到教师输入。

因为裁剪图是从无标注图像里全自动抽出来的,这套方法能适配任意图像语料。

Image

3.1 与 SOTA 模型对比

团队把 Vision-OPD 用在Qwen3.5-4B/9B上,在 V* Bench、ZoomBench、HR-Bench 4K/8K、MME-RealWorld(EN/CN)等细粒度视觉理解基准上评测。

Image

Vision-OPD-9B 拿下 79.68 的平均分,在所有对比模型中总体第一:

• 超过闭源的Gemini-3.5-Flash、Gemini-3.1-Pro;

• 超过体量大得多的开源模型,比如Qwen3.5-397B;

• 也超过各类"Thinking-with-Images"智能体模型,而 Vision-OPD 只需对图片做一次前向。

Vision-OPD-4B 的平均分也有 77.07,超过 GPT-5.4、Kimi-K2.6,说明 Vision-OPD 确实能把细粒度视觉理解的本事,有效地“装”进现有模型里。

3.2 专精却不偏科

更难得的是它专精却不偏科。在非细粒度的视觉任务(MMVP、CV-Bench、MMStar、POPE)上,它保持了原模型的看图与推理能力,没有出现专项微调常见的“学了新的、忘了旧的”。

Image

3.3 鸿沟在训练中逐渐收敛

那么 Vision-OPD 究竟有没有真的缩小这道 「区域到全局鸿沟」?训练曲线给出了直接的证据:随着训练进行,模型的区域到全局鸿沟逐渐缩小。这正印证了 Vision-OPD 让模型学会了直接从全图里识别出“裁剪才看得到”的证据,把放大聚焦的本事内化进了一次前向。

Image
Image

Vision-OPD 背后的洞见很简单:大模型的细粒度瓶颈,往往不在“认不认得出”,而在“盯不盯得住”;而模型自己在裁剪条件下的特权感知,恰好可以拿来监督它的全图行为。

它从同一个模型派生出裁剪教师和全图学生,在学生的在线采样轨迹上做 token 级自蒸馏,不用更强的外部教师、不用真值标签、不用奖励验证器,推理时也不用任何工具。仅凭约 6.2K 条全自动合成数据,就让一个 9B 模型在多个细粒度视觉理解基准上,超过了闭源模型、更大的开源模型以及 "Thinking-with-Images" 智能体模型,同时不丢通用能力。

它提供了一条可复现、低成本的细粒度视觉理解训练路径,让多模态大模型从“看个大概”走向“看清细节”。

Image
  • 袁千皓,小红书 dots 后训练团队算法实习生,现为中国科学院软件研究所中文信息处理实验室的在读博士生,在 ICML、ACL、ICCV 等自然语言处理、机器学习、计算机视觉领域顶级会议上发表数篇一作论文,主要研究方向为大语言模型后训练。

  • 连轩,小红书 dots 后训练团队算法工程师,在 ICLR、ICML、ACL、AAAI 等自然语言处理、机器学习领域顶级会议上发表数篇论文,主要研究方向为大语言模型后训练。

Image

团队介绍:

我们是 dots 基座大模型的 Post-train 团队。我们相信,模型不只是记住世界,而是真正学会在真实世界中思考、行动与自我成长。团队聚焦可验证奖励 RL、长程 agentic 智能、综合推理与自我演进等最前沿的方向,构建下一代能在复杂真实任务中可靠工作、并持续自我迭代的基座模型。

工作职责:

在以下一个或多个方向进行深度攻关。

1. Frontier Research

  • Self Evolving:提升模型进行机器学习与大模型优化的能力,探索以 AI 加速 AI 研发的新范式:让模型参与到自身的训练、部署及 Agent 调度机制的迭代中,把改进的对象从“模型本身”抬升到“产生模型的研发流程”,构建可递归的能力增益回路,持续寻找下一代能力增长曲线。

  • Lifelong Learning:探索模型“学会学习”的 Meta 能力:让模型在与陌生、开放环境的在线交互中持续更新自身内部状态,无需重新训练即可积累经验,不断提升长期的 decision making 与任务完成能力。

  • Scalable Oversight:在难以 verify 的 fuzzy / 开放式任务上,突破人类监督的扩展性瓶颈:研究可扩展的监督、自我评估与自我修正机制,让监督信号的质量能随模型能力一同增长,降低对外部人工反馈的依赖。

2. RL Algorithms

  • 研究面向长程、多轮、稀疏奖励场景的 RL 算法,系统性解决信用分配、训练稳定性、探索效率等核心问题;

  • 设计更有效、更鲁棒的奖励与评估信号,缓解 reward hacking、验证误差与奖励噪声对训练的干扰;

  • 研发 Adaptive Thinking,使模型按任务复杂度动态调整思考深度,在保证效果的同时实现高效推理;

  • 探索新的优化目标与训练范式,显著提升长程、稀疏奖励任务的收敛速度与样本效率;

  • 与 infra / 工程团队协同,推进 rollout 加速、环境稳定性、训推一致性等工程化瓶颈的解决。

3. Agentic Intelligence

  • 在 Proactive Agent、CLI/GUI 计算机控制,高价值专业知识任务、深度信息获取、 软件工程等任务上,提升模型的 Agentic 能力,让模型在高复杂度真实任务上达到行业前沿水平;

  • 构建复杂、多样、多模态、可验证的 RL 环境,在复杂 harness 上开展 blackbox RL 训练,提升模型在长程、多工具、真实环境中的规划、执行与反思能力;

  • 研究超长程任务下的多智能体协作、长程记忆与跨任务经验的积累复用;

  • 建设可规模化的 Agent 训练环境与评测体系。

4. Reasoning

  • 探索 RL Scaling Law,提升模型 general 的真实推理与反思能力(而非仅在特定任务或 Benchmark 上的表现);

  • 在人类智能密度最高的领域(如顶尖数学、竞赛编程、前沿科学等)持续突破,向达到乃至超过人类顶尖水平的方向迈进;

  • 推动推理与工具使用、真实环境的结合,并提升模型思考效率及 adaptive thinking 的能力。

任职资格

基础要求

  • 基础能力:扎实的机器学习与深度学习基础,对大模型训练全流程(pretrain / mid-train / post-train)有深入理解;

  • 解决问题:逻辑严密的分析能力,能从复杂现象中抽象出底层问题并给出系统性方案;

  • 专业能力:深刻理解并能解决 RL 训练中的核心问题,包括 Reward Hacking、Training Stability、Exploration Efficiency,以及长程信用分配、环境噪声 / 非-policy 负向 reward、训推一致性等真实工程化挑战;

  • 动手能力:优秀的算法实现能力与工程性能感知,具备优秀的数据敏锐度,能从数据中提炼出让模型效果突破的 insight。

加分项

  • 研究成果:在 NeurIPS、ICLR、ICML、CVPR、ACL 等顶级会议发表过高水平成果,或主导过知名开源项目者优先;

  • 工程与系统:熟悉大规模 RL 训练基础设施(rollout / 采样加速、sandbox 与 trajectory replay、训推框架),或有 agent harness / 可验证环境搭建经验者优先;

  • 敏锐的直觉和探索精神:具备极强的好奇心,能在高度不确定的无人区中通过严谨实验寻找确定性;不满足于优化已有 Benchmark,而对“模型是否真的在理解、在进化”保持极度敏感。

欢迎感兴趣的朋友发送简历至:[email protected]

投递链接:小红书招聘

Image