ICCV 2025 | 美团论文精选及多模态推理竞赛冠军方法分享
本文介绍了美团技术团队在国际顶会ICCV 2025中发表的5篇论文。同时,在ICCV 2025 举办的多模态推理竞赛中,美团基础研发平台/计算和智能平台组建的ActiveAlphaAgent团队,斩获赛题1真实场景视觉定位(VG-RS)冠军,赛题2空间感知视觉问答(VQA-SA)季军和赛题3创意广告视频视觉推理(VR-Ads)季军。本文也分享了这三道赛题的解题思路,希望相关研究能给同学们带来一些帮助或启发。
计算机视觉国际大会(ICCV, International Conference on Computer Vision),是由IEEE主办的顶级会议之一,与计算机视觉模式识别会议(CVPR)和欧洲计算机视觉会议(ECCV)并列为计算机视觉领域的三大顶级会议,中国计算机学会CCF推荐的A类会议。 ICCV每两年举办一次,被公认为三大会议中级别最高的会议。
01
DisTime: Distribution-based Time Representation for Video Large Language Models
论文类型:ICCV Main Conference
02
ARIG: Autoregressive Interactive Head Generation for Real-time Conversations
论文主页:ARIG
03
Advancing Visual Large Language Model for Multi-granular Versatile Perception
论文类型:ICCV Main Conference
04
A Token-level Text Image Foundation Model for Document Understanding
论文类型:International Conference on Computer Vision
论文下载:PDF
论文简介:百亿Token级掩码数据构建图文领域首个细粒度大一统基座,模态GAP不再存在 CLIP、DINO、SAM基座的重磅问世,推动了各个领域的任务大一统,也促进了多模态大模型的蓬勃发展。然而,这些经过图像级监督或弱语义训练的基座,并不是处理细粒度密集预测任务的最佳选择,尤其在理解包含密集文字的文档图像上。
为解决这一限制,我们实现了图文对齐粒度的新突破,其具备三大核心优势:
构建业内首个token级图文数据集TokenIT:该数据集包含 2000 万条公开图像以及 18 亿高质量的Token-Mask对。图像中的每个BPE子词均对应一个像素级掩码。数据体量是CLIP的5倍,且比SAM多出7亿数据对。
构建图文领域首个细粒度大一统基座TokenFD:仅需通过简单的一层语言编码,依托亿级的 BPE-Mask 对打造出细粒度基座 TokenFD。真正实现了图像Token与语言Token在同一特征空间中的共享,从而支持Token级的图文交互和各种下游任务。
TokenVL打通模态GAP:进一步开放图像即文本的语义潜力,首次实现在大语言模型中进行token级的模态对齐,赋能密集型的多模态文档理解任务。
05
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
论文类型:ICCV Main Conference
论文下载:PDF
论文简介:受多模态大型语言模型 (MLLM) 推动,用于图像和视频领域的文本引导通用分割模型近年来取得了快速发展。然而,这些方法通常是针对特定领域单独开发的,而忽略了这两个领域在任务设置和解决方案上的相似性。本文首先把图像和视频级的参考分割和推理分割的统一归到指导视觉分割 (IVS)框架下,并提出了 InstructSeg,一种专用于 IVS任务 的 基于MLLM 的端到端分割模型。InstructSeg利用目标感知的视频感知器从参考帧中提取时间和目标双重信息,从而提升模型的视频理解能力。此外,我们引入了视觉引导的多粒度文本融合,更好地将全局和细节的文本信息与细粒度的视觉引导相结合。通过利用多任务和端到端训练,InstructSeg 在各类图像和视频任务中表现出色,仅通过单一模型超越了以往的分割专家模型和基于 MLLM 的方法。
ICCV 2025 多模态推理竞赛解题方案
大推理模型(LRM)时代已经来临,这为计算机视觉领域带来了新的机遇与挑战。大语言模型(LLM)强大的语义智能与大推理模型(LRM)的链式推理能力,为视觉理解和解释开辟了新的前沿领域。
为了弥合计算机视觉与大语言/推理模型之间的鸿沟,本次会议将探讨多模态大模型如何通过思维链(Chain-of-Thought)、多步推理(Multi-step Reasoning)等慢思考方法理解复杂关系,深入理解复杂场景中的对象交互。在此背景下,本次举办的Challenge on Multimodal Reasoning,重点关注需要高级推理能力的多模态复杂任务,具体包括:
赛题1:真实场景视觉定位(VG-RS),评估模型在复杂多模态场景中的场景感知、物体定位与空间推理能力。
赛题2:空间感知视觉问答(VQA-SA),评估模型基于具体物理规律,遵循用户指令进行空间推理、常识推理与反事实推理的能力。
赛题3:创意广告视频视觉推理(VR-Ads),评估模型在广告视频中理解非物理性及抽象视觉概念的认知推理能力。
三道赛题均未提供官方训练数据,最终需要提交模型和推理方案由组委会进行复现。
美团/基础研发平台/计算和智能平台部组建的ActiveAlphaAgent团队参加了ICCV 2025举办的Challenge on Multimodal Reasoning,斩获赛题1真实场景视觉定位(VG-RS)冠军,赛题2空间感知视觉问答(VQA-SA)季军和赛题3创意广告视频视觉推理(VR-Ads)季军。
赛题1:真实场景视觉定位(VG-RS)
解决方案简介 | 我们提出了一种结合信噪比驱动数据合成、多阶段对齐与强化训练的视觉定位框架VG-SMART。具体而言:
1. 首先通过精心调优prompt提升SOTA模型在该任务上的表现, 并集成多个SOTA模型结果合成初始数据集;
2. 随后在初始数据集上为每条数据采样计算pass rate,并基于自定义信噪比(SNR)指标对数据进行严格筛选构建有难度的高质量合成数据集;
3. 然后基于高质量的合成数据集进行Qwen2.5-VL-72B-Instruct的多阶段训练,包含监督微调(SFT)阶段和采用IoU中心奖励函数的强化学习(RL)阶段;
4. 最终我们将训练好的Qwen2.5-VL-72B-Instruct蒸馏至Qwen2.5-VL-7B,在保持性能的同时优化了推理速度,在排行榜上以0.6671分获得第一名。
赛题2:空间感知视觉问答(VQA-SA)
解决方案简介 | 我们提出了一种适合多模态VQA任务的多阶段数据合成与训练框架STAGES,具体包括:
1. 首先以无答案的比赛图片为种子利用图搜工具检索与比赛数据相似的图片,并参考比赛数据集形式,精心调优prompt,利用LLM和LVLMs合成80万类似VQA数据;
2. 然后在这80万合成数据上对Qwen2.5-VL-72B-Instruct进行第一阶段SFT,显著提升了模型在该类任务的表现;
3. 接着在无答案比赛数据集上,我们进一步精调多个SOTA模型prompt,并以集成方式合成出少量高置信的比赛数据样本,之后使用这批合成数据对Qwen2.5-VL-72B-Instruct进行第二阶段SFT,进一步提升了模型在比赛数据上的表现;
4. 最终我们将训练好的Qwen2.5-VL-72B-Instruct蒸馏至Qwen2.5-VL-7B,在保持性能的同时优化了推理速度,在排行榜上以0.6972分获得第三名。
赛题3:创意广告视频视觉推理(VR-Ads)
解决方案简介 | 我们提出了面向创意广告视频的测试时策略调优与自适应推理方法T-STAR,该方案聚焦于优化Qwen2.5-VL-72B-Instruct的推理策略,通过精细调节关键推理参数来最大化模型在该复杂任务中的固有推理能力。具体方法:
1. 首先对视频采样帧率和图像分辨率进行了系统实验,探索视觉信息密度与处理效率之间的权衡;
2. 在此基础上,我们叠加了约束性拒绝采样策略,确保输出简洁且符合任务要求;
3. 最终,我们以Test-time scaling方式,使用Qwen2.5-VL-72B-Instruct以0.53分在最终排行榜上位列第三。
---------- END ----------
美团科研合作致力于搭建美团技术团队与高校、科研机构、智库的合作桥梁和平台,依托美团丰富的业务场景、数据资源和真实的产业问题,开放创新,汇聚向上的力量,围绕机器人、人工智能、大数据、物联网、无人驾驶、运筹优化等领域,共同探索前沿科技和产业焦点宏观问题,促进产学研合作交流和成果转化,推动优秀人才培养。面向未来,我们期待能与更多高校和科研院所的老师和同学们进行合作。欢迎老师和同学们发送邮件至:[email protected]。