元宇宙与人工智能三十人论坛

南大团队戳破大模型“高分神话”

大模型真的像榜单分数显示的那样无所不能吗?南京大学傅朝友团队给出了一个截然不同的答案。
4月13日,南大团队正式发布视频理解新基准 Video-MME-v2。这套基准历经近一年准备,由12名标注人员和50位独立审核人员共同完成,投入超过3300人工时,在Google Gemini评测团队邀约下推出。
Video-MME-v2最大的创新在于引入了“分层能力体系”和“组级非线性评分”两大设计。传统评测采用每题独立计分,模型可以靠碎片化的局部正确获得高分;而新基准将视频理解拆分为信息检索与聚合、时序理解、复杂推理三个递进层次,并要求模型在一组相关问题上表现出一致性和连贯性——如果推理链条某一环断裂,即使最终“碰巧答对”也不算分。
换了新测法之后,结果令人震惊。
在传统准确率指标下,人类专家得分高达94.9;而换成非线性评分后,人类得分依然稳定在90.7。但当前最强的商业模型Gemini-3-Pro,非线性得分仅49.4,开源模型Qwen最佳结果更是低至39.1。
传统评测分数日趋饱和,可真实体验中“看起来懂了,一考就露馅”的现象比比皆是。Video-MME-v2揭示了这一长期被掩盖的事实:现有评测范式正在逐渐“失真” 。真正理解视频,需要从碎片化感知走向连贯性推理,而这恰恰是目前大模型的短板。
值得一提的是,傅朝友团队在视频理解评测领域已有深厚积累。其第一版Video-MME被Gemini、GPT等广泛采用,在CVPR 2025所有录用论文中影响力排名第一,引用超1100次。
当大模型纷纷宣称自己“接近人类”甚至“超越人类”时,这套新基准就像一把精准的尺子,量出了人与机器之间那道真实存在、尚未跨越的鸿沟。高分神话的泡沫,正在被理性而严苛的评测戳破。