MMEVALPRO: 更加可靠、高效的多模态大模型评测基准
作者:MMEvalPro 团队
单位:北京大学,中国医学科学院,香港中文大学,阿里巴巴
摘要: 近期,多模态大模型如GPT-4o、Gemini-pro和QwenVL-Max在各类评估中崭露头角,频频登上排行榜前列。然而,这些排行榜的可信性引发了学界对现行评估标准公正性的反思。来自北京大学、中国医学科学院、香港中文大学及阿里巴巴的科研团队,携手对现有评测流程的准确性和可信度提出了严格的质疑。他们的研究成果揭示了一个令人惊讶的现象:即便在未直接观察图像、未能深入理解题目情境的前提下,大语言模型仍能表现出接近最先进技术水平(SOTA)的性能,这显然背离了多模态评测旨在考察的综合理解能力的初衷。
为了应对这一挑战,并确保评测基准的严谨性与实用性兼备,该研究团队创新性地推出了MMEVALPRO,一个专门用于检验多模态大模型性能的全新评估框架。初步实验验证显示,当前市场上备受推崇的多模态大模型在MMEVALPRO的严格审视下,其实际实力远未达到公众普遍预期的高度。相比现有的评估数据集,MMEVALPRO设定了更为严苛的考验门槛。根据实验结果,目前表现最优的大语言模型(LMM)在MMEVALPRO上的表现与人类水平之间存在31.73%的显著差距,而这一差距在此前的基准测试中仅被估测为8.03%。此外,LLM和LMM在MMEVALPRO上的性能差距也远超过原始评测数据集,突显了新基准在甄别模型真正多模态理解能力方面的高要求与可信性。
论文: MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
项目主页: https://mmevalpro.github.io/
论文: https://arxiv.org/abs/2407.00468
GitHub: https://github.com/chenllliang/MMEvalPro
数据集: https://huggingface.co/datasets/MM-Diagnose/MMEvalPro
机构:北京大学,中国医学科学院,香港中文大学,阿里巴巴
当前的多模态评估方案有多不靠谱?
评测结果的可靠性是衡量评测体系有效性的一个核心指标,这一原则对于评估多模态大模型(LMMs)的性能尤为关键。当前多模态大模型的评测标准普遍采用了一种包含图片、问题、候选答案和正确答案的多项选择题(MCQ)形式,这种评测模式因其操作便捷性而广受欢迎,相较于纯文本评估或依赖人类专家的传统方法,显示出了更高的效率优势。但不容忽视的是,多项研究表明MCQ评估法内含一定的偏颇性,可能为大语言模型提供了利用模式而非深度理解来解题的“捷径”,从而对评测的公正性和准确性构成了挑战。
构建评测基准的一个基本前提假设是,得分更高的模型在性能上理应超越低分模型。为了深入探究现有LMM评测基准的可靠性,研究人员精心设计并实施了两项重要测试——“看与不看的比较测试”与“答案一致性测试”,选取MMMU、ScienceQA、MathVista这三个具有代表性的多模态基准数据集作为研究对象。这些测试旨在揭示模型在不同条件下的表现差异,以及其回应是否真正基于对问题的深入理解和多模态信息的整合,而非单纯依赖试题结构或模式识别,从而为LMM的真实能力评估提供更为坚实的依据。
看与不看的比较测试
针对每一项评测基准数据集,研究团队精心构造了两种版本的测试材料:一种是完整包含图像信息的“Seeing”版本,用以评估多模态大模型(LMMs);另一种则是移除了图像信息的“Not-Seeing”版本,专门用于测试纯文本处理的大语言模型(LLMs)。通过对比这两个版本的测试结果,研究揭示出一个引人深思的现象。
实验数据显示,即便在无法查看图像的情况下,大语言模型依然能够在当前的多模态评测基准上取得接近乃至偶尔超越那些能够接收到视觉输入的多模态模型的高分。这一发现颠覆了预期,因为理论上,纯语言模型不具备任何图片理解能力,应该在这些所谓的“多模态评测”中取得最低的成绩。实验进一步指出,LLMs与LMMs之间的性能界限模糊,二者在评测中的表现差异微乎其微,这与我们对模型实际应有能力的直观认知背道而驰。
如下图所示,研究清楚地证明,即便缺乏对视觉数据的处理,当前最优的大语言模型依旧能够在评测中取得佳绩,这样的结果不仅挑战了评测基准的有效性,也对多模态模型声称的高级理解与综合能力提出了质疑。这种现象强烈指出现有的评测体系未能恰当地区分和衡量模型处理多模态信息的真实效能,亟需更精确、少偏见的评估机制来确保评测结果真实反映模型能力。
答案一致性测试
除了Seeing与Not-Seeing测试,,研究团队还深入进行了答案一致性检验,旨在进一步剖析多项选择题(MCQ)评测中的潜在问题。该测试揭露了一个突出的现象:评测中频繁出现Type-I错误,意味着模型即便在缺乏实质理解的情况下,也能偶然给出正确答案。举例来说,在某具体场景中,尽管模型能够精准计算某个角度的度数,却无法在图像中正确辨认出该角度的实际标识,而这本应是完成度数计算前的基本前提。这一发现提示我们,模型或许利用了一些非直观的“解题策略”或数据中的偏差来间接获得正确答案,而非依靠真正的知识理解和多模态解析能力。
这种情况明确指出了当前评测体系的一个重大缺陷:模型答对题目并不直接等同于其掌握了相应的技能或理解力。模型可能凭借数据中的某些特定模式或纯粹的概率推理“碰巧”作对题目,而非基于对问题内容的深刻把握。因此,这些评测结果可能夸大了模型的真实能力,强调了开发更为精细、能有效区分模型真正理解力与表面正确率之间差别的评测方法的迫切性。
鉴于上述分析揭示的现有多模态模型评估中存在的根本性问题,特别是评测结果的不可信度以及模型可能采取的非理解性“解题策略”,研究团队针对性地设计并提出了MMEVALPRO这一先进的评估框架。MMEVALPRO不仅旨在修正当前评测数据集的缺陷,而且力求通过增强测试的复杂度与综合性,减少Type-I错误的发生,确保模型必须基于深入的理解与合理的推理过程才能得出正确答案,而非依赖于数据中的巧合或偏差。
MMEVALPRO评测构建
为了解决现有多模态评测基准的评估可靠性问题,并确保评测既高效又准确,研究团队创新性地设计了MMEVALPRO评测数据集,专为多模态大模型的MCQ评测而定制。该数据集通过对MMMU、ScienceQA、MathVista这三个典型领域的原始问题进行深度加工和扩展,不仅保留了原有问题的挑战性,还额外添加了与之紧密相关的感知问题与知识问题的标注。这一设计要求模型在正确解答原始问题的同时,也必须理解与问题相关的视觉细节(感知问题)和背景知识(知识问题),以此作为正确回答的必要前提。
在此基础上,研究团队引入了一项新的评价指标——“真实准确率”(Genuine Accuracy)。这一指标衡量了模型同时正确回答原始问题、相关感知问题和知识问题的能力,从而为模型的综合理解力和多模态处理能力提供了更为精确的量化评估。与传统准确率相比,“真实准确率”更能剔除非理解性解题的干扰,真实反映模型的深层次理解水平。
下图展示了几例MMEVALPRO数据集中增强后的问题示例,直观展示了如何通过增加问题维度来提高评测的严谨性和全面性。
下图详细描绘了这一数据标注的全过程,研究团队的首要步骤是从现有的多模态评估标准数据集中精心挑选出代表性问题,并采用人工标注的方法系统性地为这些问题增补了感知问题与知识问题的标准。每一道问题及其新增的感知与知识维度均历经了至少两轮的专家复核,以最大限度地保证标注质量与一致性。
MMEVALPRO整合了来自MMMU、ScienceQA、MathVista三个关键领域的2138个问题三元组,每个三元组由一个原问题、一个感知问题和一个知识问题组成,共计形成了6414个独立的评测问题。以下是关于MMEVALPRO数据集更具体细节的概述,通过下面三个图表来展示:
实验结果
研究者在所提出的MMEVALPRO评测基准上对SOTA的LLMs与LLMs进行了性能评估。具体而言,即便是当前表现最优的多模态大模型,如QwenVL-MAX和GPT4o,在MMEVALPRO上实现的“真实准确率”(Genuine Accuracy)与人类表现之间,依然存在着约30%的显著差距。这表明,即使是在最尖端的模型中,多模态理解能力仍有极大的提升空间。此外,经过MMEVALPRO的严格校准,大语言模型(LLMs)与多模态大模型(LMMs)之间的性能差异变得更加清晰明了:最优LMM相对于最优LLM的性能优势扩大到了23.09%,而在之前的评测基准中,这一差距仅为14.64%。
如下图所示,与原始评测数据集相比,LLM和LMM在MMEVALPRO数据集上的性能差距更为显著。性能最佳的LLM和LMM在多模态数据集上的表现,从原始数据集中的最大1.5倍分数差距扩大到了MMEVALPRO中的4.8倍分数差距。这真实地反映了模型在实际多模态理解能力上的差异,有效地避免了LLM因为利用捷径而获得高分的情况。
为了进一步分析MMEVALPRO的挑战性,研究者对最优的LLM和LMM的回答一致性(两类问题之间的条件概率)进行了可视化分析。根据实验结果,人类在评测的问题集上表现出高度的一致性,相比之下,与LMM和人类相比,LLM的一致性则最低,这是由于LLM在多模态问题的回答上缺乏一致性的解决路径,这也进一步保证了MMEVALPRO的评测可信度。
小结
MMEVALPRO是一个全新的多模态评测基准,旨在通过感知与前置逻辑知识来校准多模态大模型的评测流程,以此提升评测结果的可信度。MMEVALPRO能够更加准确地反映被测多模态大模型的真实能力,并具备更加可信的评测指标,同时MMEVALPRO也更具备挑战性。欢迎大家在MMEVALPRO数据集上进行评测,并分享结果,提供反馈。
GitHub: https://github.com/chenllliang/MMEvalPro