Geek Savvy

Llama4 登顶排行榜,是实力碾压还是“精准刷分”?

Image

清明放假那会,Meta 开源了 Llama 4,说是要成为开源 AI 里的“世界第一”,是开发者们的新福音,摆明了要跟 GPT-4o、Gemini 这些大佬掰手腕,争夺 AI 界的头把交椅。

Image

而且,Llama 4 的纸面实力(一些基准测试)确实吓人。它用了的“混合专家架构”(MoE),说是效果跑起来又快又省钱;还能同时处理文字、图片、视频和声音,是个“全能选手”;还有更牛的就是,一个叫 Scout 的版本的,号称能一口气读懂 1000 万 token 的内容,什么概念?那可是相当于几百本书或者几十个小时视频的量啊。

Image

成绩单更是 nb plus,在那些衡量 AI 聪明程度的“考试”,比如 MMLU Pro(考各种知识理解)、MathVista(考数学和看图推理)、GPQA Diamond(考超难的科学问题)里,Llama 4,特别是那个叫 Maverick 的版本,分数蹭蹭往上涨,好几个项目都拿了第一,把之前大家觉得很牛的模型甩在了身后。一时间,全球科技圈都在讨论 Llama 4,觉得 AI 的新时代又来了。

Image

但是!正当我们惊叹的时候,一些“不对劲”的声音开始出现了。有人悄悄嘀咕:这分数,高得有点离谱了吧?会不会是……“刷”出来的?甚至还有公司高管因为这些原因离职了,一时间,“作弊”、“刷分”这些词,已经和 Llama 4 这个名字绑在了一起。

Image

01 AI“考试”和“刷分”是什么

在咱们深入扒 Llama 4 的“瓜”之前,得先简单说说这俩概念。

所谓的 AI“考试”,就是基准测试(Benchmark)。你可以把它想象成给 AI 们准备的“高考卷”或者“期末大考”。出题人设计各种各样的题目,比如阅读理解、数学计算、写代码、常识问答等等,然后让不同的 AI 模型来做。谁分数高,就说明它在这些方面可能更“聪明”。这对于研究人员比较模型好坏、用户选择用哪个 AI,都挺重要的,算是个相对公平的尺子。

Image

那“刷分”又是啥呢?这就有点像咱们上学时候遇到的“偏科生”或者“应试高手”了。它不是说 AI 真的长了手去改分数,而是指 AI 在学习(训练)的时候,可能走了“捷径”。比如:

第一,“偷看答案” (数据污染):就是训练 AI 的海量资料里,不小心混进了考试题目或者和题目极其相似的内容。AI 等于提前“背”了答案,考试时自然分数高,但这不代表它真理解了。

第二,“只练题型” (针对性优化):就是开发团队太想让 AI 在某个考试里拿高分了,就拼命调整 AI,让它特别擅长做这种题。结果就是,考试题目它会做,稍微换个问法或者拿到真实场景里,可能就傻眼了。

反正,“刷分”得来的高分,往往有点虚,不能完全代表 AI 的真实、全面的能力。

03 Llama 4“作弊”被抓包

这部分就是大家最关心的了,到底有哪些证据让人们怀疑 Llama 4 在“耍小聪明”呢?咱们一条条来看:

证据一:“偷看”考试题,有自称是 Meta 内部员工的人在网上爆料,说团队为了赶进度、要成绩,可能在 Llama 4 训练的后期,悄悄把 MMLU Pro、MathVista 这些考试的部分题目或者极其相似的内容,喂给了 Llama 4。更有人发现,Llama 4 在回答某些数学题时,给出的答案模式和测试集里的一模一样,但如果把题目稍微变动一下,它就答不出来了。这就很让人怀疑它是不是“背”了题。

Image

证据二:直接让写代码就“露馅”, AI 写代码的能力现在可是个热门指标。Llama 4 在像 Kscores、LiveCodeBench 这些编程“考试”里分数也不错。但有开发者(比如 X 上的 @deedydas)拿大家都能下载到的 Llama 4 公开版一测试,发现根本不是那么回事!别说高难度的编程任务了,就连一些基础的小问题都解决不了(比如那个经典的小球反弹测试都失败了)。这和榜单上的高分比起来,差距也太大了,让人觉得榜单分数水分不小。

Image

证据三:交卷用的是“特供小号”,有个叫 LM Arena 的平台,是大家公认比较权威的 AI 对战和排名榜。有人发现,Meta 提交到 LM Arena 上供大家匿名评分的 Llama 4 Maverick 版本,和开发者能下载到的公开版本,行为方式明显不一样。

比如,榜单上的那个版本说话特别啰嗦,还老爱加表情符号,而被 TechCrunch 等媒体扒出来后,大家才发现这可能是个专门为了在聊天评分里拿高分的“特供版”、“小号”,跟公开版的简洁风格完全不同。这就好比汽车厂商送去给媒体评测的是一辆经过特殊调校的“赛道版”,而不是你实际买到的家用车。

证据四:能读超长文章, Llama 4 的 Scout 版本号称能处理 1000 万 token 的超长上下文,现在现场的上下文应该的 Gemini 2.5 的 100万(200万的还没推出)。但用户实际测试(比如让它翻译很长的文档,或者在长文里找信息),发现效果远没有宣传的那么好,信息召回率低,错误多,处理长文本的能力似乎被夸大了,可能只是在特定的长文本“考试”(比如 MTOB)上做了优化。

Image

1000万上下文的召回率,上下文实际表现,远低预期

这些质疑的声音,不光来自匿名爆料,还有科技媒体的调查报道、独立研究人员(比如谷歌的工程师 Susan Zhang)的公开质疑,以及在 Reddit、X 等平台上开发者社区里大量的实测和讨论。可以说,这次对 Llama 4 的质疑,范围广,声音大。

04 Meta 官方怎么说

面对这么多的质疑,作为“当事人”的 Meta 是怎么回应的呢?

嗯……有点微妙。

对于 LM Arena 上的版本差异,Meta 倒是承认了,说那个确实是个“为了对话体验优化过的版本”,但强调核心技术和公开版是一样的。潜台词好像是:我们是优化了,但不算作弊?

对于社区里那些测试 Llama 4 不行的结果,Meta 的官方说法大概意思是,这些第三方测试可能方法不够严谨,或者没用好“提示词”,所以结果不准。那有点“甩锅”给测试者的意思。

但对于最核心的指控,比如“数据污染”(偷看答案)以及传闻中有高管(副总裁 Joelle Pineau)因为这事儿不满而辞职的消息,Meta 基本是保持沉默,没有正面回应。

总的来说,Meta 的回应并没有完全打消大家的疑虑,反而因为对关键问题的回避,让一些人觉得更加可疑了。

Last but not least

好了,扒了这么多,Llama 4 这事儿到底该怎么看呢?

首先得承认,Llama 4 本身在技术上(比如那个 MoE 架构、多模态能力)肯定是有不少亮点的,Meta 在 AI 研发上的投入和实力毋庸置疑。但是,这次围绕它的“刷分”风波也确实给我们敲响了警钟。

Llama 4 的高分,到底有多少是真实能力的体现,有多少是“应试技巧”或者“数据污染”的结果?目前谁也说不清,可能只有 Meta 自己知道。但这事儿至少说明,我们现在用来评价 AI 的这些“考试”(Benchmarks),确实有不小的局限性,很容易被“针对性优化”甚至“作弊”。光看榜单分数,真的不一定靠谱。

而且,在 AI 竞争如此激烈的今天,大公司为了抢排名、争眼球,会不会在宣传甚至研发上走一些“捷径”?这次 Llama 4 的争议,也引发了大家对 AI 行业伦理和透明度的担忧,特别是对 Meta 这样标榜“开源”的公司,大家可能会有更高的期待。

从 Llama 4 这次风波来看,在追逐越来越聪明的 AI 时,或许真实和信任,比冷冰冰的排行榜数字更重要。

未来,我们需要更聪明、更可靠、更难被“刷分”的 AI 评估方法。而对于我们这些关注 AI 的普通人来说,保持一点点批判精神,多看看实际应用效果,而不是只盯着排行榜上的数字,可能才是更明智的态度吧。毕竟,AI 要真正改变世界,靠的是真本事,而不是虚高的分数。