清华发布 AI 评测报告:14 个海内外大模型横评,国内模型表现亮眼
在2023年的“百模大战”中,众多实践者推出了各类模型,这些模型有的是原创的,有的是针对开源模型进行微调的;有些是通用的,有些则是行业特定的。如何能合理地评价这些模型的能力,成为关键问题。
尽管国内外存在多个模型能力评测榜单,但它们的质量参差不齐,排名差异显著,这主要是因为评测数据和测试方法尚不成熟和科学。我们认为,好的评测方法应当具备开放性、动态性、科学性和权威性。
为提供客观、科学的评测标准,清华大学基础模型研究中心联合中关村实验室研制了SuperBench大模型综合能力评测框架,旨在推动大模型技术、应用和生态的健康发展。
SuperBench介绍请查看以往推送:2024年,如何避免「国内百模,家家第一」乱象?
近期,我们发布了2024年3月的《SuperBench大模型综合能力评测报告》。在此评测中,我们选定了14个海内外具有代表性的模型进行测试。对于闭源模型,我们选取API和网页两种调用模式中得分较高的一种进行评测。
整体来说,GPT-4系列模型和Claude-3等国外模型在多个能力上依然处于领先地位,国内头部大模型GLM-4和文心一言4.0表现亮眼,与国际一流模型水平接近,且差距已经逐渐缩小。 国外大模型中,GPT-4系列模型表现稳定,Claude-3也展现了较强的综合实力,在语义理解和作为智能体两项能力评测中更是获得了榜首,跻身国际一流模型。 国内大模型中,GLM-4和文心一言4.0在本次评测中表现最好,为国内头部模型;通义千问2.1、Abab6、moonshot网页版以及qwen1.5-72b-chat紧随其后,在部分能力评测中亦有不俗表现;但是国内大模型对比国际一流模型在代码编写、作为智能体两个能力上依然有较大差距,国内模型仍需努力。
大模型能力迁移&SuperBench
评测方式:收集了72个中英双语传统数据集,提取其中高难度的题目组成4个维度的评测数据集,采取零样本 CoT 评测方式,各维度得分计算方式为回答正确的题目数所占百分比,最终总分取各维度的平均值。
评测流程:根据不同题目的形式和要求,对于模型的零样本 CoT 生成的结果进行评分。
知识-常识:Claude-3以79.8分领跑,国内模型GLM-4表现亮眼,超过GPT-4网页版位居第二;文心一言4.0表现不佳,距离榜首Claude-3有12.7分差距。
知识-科学:Claude-3依然领先,并且是唯一一个80分以上模型;文心一言4.0、GPT-4系列模型以及GLM-4模型均在75分以上,为第一梯队模型。
数学:Claude-3和文心一言4.0并列第一,得65.5分,GLM-4领先GPT-4系列模型位列第三,其他模型得分在55分附近较为集中,当前大模型在数学能力上仍有较大提升空间。
阅读理解:各分数段分布相对较为平均,文心一言4.0超过GPT-4 Turbo、Claude-3以及GLM-4拿下榜首。