“人类的终极考试”发布:AI最高38%,你能答对几题?
在人工智能迅猛发展的时代,我们常常听到AI如何“超越人类”的故事:从围棋冠军到编程,AI们似乎无所不能。然而,一场名为“Humanity's Last Exam”(人类的终极考试,简称HLE)的基准测试,却难倒了目前的最先进的AI。
HLE的起源可以追溯到2025年初,当时现有AI基准如MMLU(大规模多任务语言理解)已被顶级模型轻松攻克,准确率超过90%。这让研究者意识到,需要一个更难、更前沿的测试来追踪AI进步。于是一场全球协作拉开帷幕:由AI安全中心(Center for AI Safety)、Scale AI和HLE贡献者联盟主导,近1000名专家(大多为教授、研究员和研究生)从500多家机构、50多个国家贡献问题。
这些问题并非随意设计——每道题都经过严格筛选:必须原创、精确、无歧义、可验证,且无法通过简单互联网搜索或模式匹配解决。最终,HLE于2025年4月3日定稿,并公开发布在Hugging Face平台。
这份“终极试卷”设计非常精妙:76%为精确匹配题(如计算或短答),24%为多选题;14%涉及多模态元素,如图像分析(例如翻译古罗马铭文或识别鸟类微观解剖结构)。
2500道问题的难度直指人类知识前沿:从鸟类生态学中的微观结构,到古帕尔米拉语的翻译,再到高等数学的证明。HLE还有动态版本“HLE-Rolling”,允许持续更新,以防AI“作弊”通过记忆。
HLE一经发布,就成了AI界的“噩梦”。早期测试中,2025年的顶级模型表现惨淡:OpenAI的GPT-4o正确率仅为2.7%,Claude 3.5 Sonnet 4.1%,o1模型也只有8%。即使是多模态模型,如Gemini 2.5 Pro,也仅21.6%,这些分数远低于人类专家预期。
随着2026年的到来,AI模型迭代加速,成绩有所提升。但即便在最新评估中,最高分也仅勉强“及格”。根据CAIS AI仪表盘和SEAL LLM排行榜,截至2026年2月,以下是部分前沿模型在HLE上的表现(基于标准公共数据集,准确率%):
Calibration Error (%)衡量AI模型的自信度(confidence) 与其实际正确率 是否匹配。简单说,就是模型说“我对这个答案有80%的把握”,它真的应该在类似问题上正确80%的时间。如果模型经常给出错误答案却还非常自信(overconfident),或者对正确答案反而低估(underconfident),校准误差就会很高,也就是AI过于高估自己。
HLE的低分并非意外设计——问题筛选时就剔除了AI能轻松解答的那些。根源在于AI的“浅层学习”:它们擅长模式匹配和数据检索,但缺乏人类般的深度语境理解和创新推理。
AI准确率随推理token(思考步骤)增加呈对数线性增长,但超过2^14 token后效率下降,暴露计算瓶颈。
所有公布的题目和答案可以在这个网址找到(https://huggingface.co/datasets/cais/hle),以下是部分题目,大家有兴趣的可以试一下,看看自己是不是比AI还强。
1.在现代以色列国,哪部法令首次明确引入了“诚信”的概念?
2.2004年至2008年期间,美国非机构RMBS价值最可能由哪些根本原因决定?选项:A. 标普500指数的股市水平;B. 资产池中浮动利率债务的比例;C. 贷款的平均FICO信用评分;D. 10年期美国国债利率;E. 违约率;F. 贷款发行人和RMBS发起人的资质;G. 回收率;H. 发行时信用评级机构的评级。
3.有3枚硬币,每枚硬币正面朝上的概率均为1/3。已知反面朝上的次数始终为偶数。求这3枚硬币全部正面朝上的概率是多少?
4.一家酒店有100个房间,每个房间都有一盏灯,灯光会循环变换红、绿、蓝三种颜色。最初,所有灯都是红色的。100位客人依次入住。第n位客人每隔n个房间拨动一次灯,重复n次。每位客人离开后,一只猫会将所有绿灯重置为红色。最后,有多少盏灯会变成蓝色?
5.正如库尔特·冯内古特所说,这个人所有的照片都像一只豪猪。请用两个以相同字母开头的单词来称呼这个人(As Kurt Vonnegut noted, this man looks like a porcupine in all the pictures. Name this man in two words that start with the same letter.)。
6.星际争霸背景故事中第二次世界大战持续了多久(以年为单位,向上取整)?
7.哪位以显微镜领域研究而闻名的物理学家,在一名清洁凹面镜的清洁工偶然观察到真实图像中的光学效应后,发现了这种效应?
8.一种说法是,在19世纪的北欧,在烟雾弥漫、空气污浊的城市里,人们根本看不到它们——不像米兰那样。然而,德国人卡西米尔·格拉夫承认,他只是缺乏足够的想象力来描述它们。请准确说出它们的名称。
将于一天之后在评论区公布答案
也许哪一天,某个AI达到100%正确率后,人类就应该警惕了,要随时准备拔插头。