OpenAI依然遥遥领先,附o3 ARC-AGI测试报告
现在,OpenAI 12天的发布会已经结束了,面对谷歌以及各大 AI 科技巨头的狙击,OpenAI 是否还处在一个领先地位呢?
先说答案。
是的,OpenAI 还处于领先地位,主要是在时间节点上的先发优势。
o3 的推理能力大幅度提升,并不代表 AGI 已经都来,官方也表示,他们不认为 o3 就是 AGI,在很多简单问题上,还是会出现错误,而且成本很高。
我们先来回顾一下 OpenAI 过去12天的一系列发布,从中我们可以看出 OpenAI 在创新和应用方面的领导野心越来越答。以下是由 GeekSavvy 按重要性降序排列(仅供参考):
新推理模型 o3 和 o3-Mini:它们打破了之前的很多基准测试和记录,表明 AI 的进步并未放缓,离 AGI 又近了一步。
API 接口更新:开发者可通过 API 访问 o1 模型,并且音频价格有所降低。
o1 强化微调:通过少量的数据微调模型,可尝试将模型定制成主流模型,更好的适应专业场景(不过是期货)。
新建文件夹:用户可以在聊天对话中创建文件夹,在企业服务会有更多的可操作性。
Canvas 升级:在写作和编码增强了 AI 协作,用户可直接运行 Python。
o1 正式版:o1 正式版比预览版在各种测试中更优秀,Pro 用户可使用更加会“思考”的 o1 Pro 模型。
GPT-4o实时视频通话:现在可以使用视频通话跟 ChatGPT 聊天了,还能给 AI 共享屏幕。
Chat GPT 桌面应用:支持更多应用程序和高级语音模式,可获取其他应用信息,可玩性更大了。
1-800-CHATGPT:可以直接拨打热线电话来获得问题的答案。
ChatGPT 搜索:搜索功能更新了交互样式,语音对话也能用,并且免费,现在所有用户都可以用。
Sora 视频生成:文本转视频模型终于发布了,Sora 效果很一般,被谷歌用 Veo 2 抢占风头。
Apple 集成:ChatGPT 集成到一些写作工具和 Siri。
就模型而言,虽然 OpenAI 有先发优势,但 Anthropic、Google、Meta等公司也不会落后太多,下一代模型的竞争仍在加速,并且短期内看起来不会放缓。
Google 在 OpenAI 同一天推出新功能时进行了狙击,它在一周前推出了自己的屏幕共享功能(与 OpenAI 扩展的视频聊天功能竞争)Gemini 2.0 Flash,并在Sora之后,立即推出了其文本到视频模型 Veo 2,在质量上完全超越了 Sora。
但随着最后一天,OpenAI 推出 o3,在科学问题上大幅度超越专家博士,OpenAI 继续表示自己是市场领导者,尽管 o3和 o3 mini 的公开发布时间表仍不明确,官方表示正在公开寻求更多的安全测试,从目前来看,还是处于领先地位。
o3 在编码基准测试中,比已经创下纪录的 o1 好 20% 以上,而且 o3 的领先优势更大。在故意设置的难度 ARC 基准测试中,该基准测试旨在让 AI 难以完成,但却能代表人类的日常工作,AI 花了四年时间才取得 5% 的成绩,o3 却击败了人类的表现(约 85%) ,不过,o3 的最佳性能需要多花 1,000 多美元的作为代价。
o3-Mini 继续以更低的成本超越上一代 o1 的性能, OpenAI 似乎意识到,仅仅拥有强大的能力是不够的。如果大多数人不需要最聪明的模型,那么拥有最聪明的模型就没那么重要了。
所以,真的有很多人需要博士学位级别的模型吗?如果成本降低10倍,大学水平的模型是不是就足够了?这才有了 o3 mini,o3 对于大多数来说,其实并非是刚需,成本还那么高,发布会中也没有提到使用 o3 的成本是多少,简单问一个问题,就要消耗3500刀,20000多人民币啊,所以 o3 放出来只是在表明 OpenAI 目前还处于“遥遥领先”的地位,暂时不会放出来,除非成本下来了。
最后,也是很多人不 care 的,OpenAI 在其基础设施的推动,一个1-800号码、桌面应用和 WhatsApp 集成,满足了更多普通人当前的需求,可能会导致那些更固守旧习惯的用户更广泛地采用,从而占据更多的用户心智,为商业化之路做好更多的布局准备。
从这12天一系列发布的东西来看,从最强推理模型 3o,到各种微调和 API 开放,OpenAI 在技术上还是处于先发优势,又对 ChatGPT 进行各种能力扩展,以及接入各种生活场景的应用,降低了更多的人使用 AI 的门槛。所以,无论从技术、市场、产品来说,OpenAI 的野心还是很大的,依然掌握着 AI 邻域的一个重要话语权,这次12天发布会这么多人围观就是一个客观的例子。
以下是 o3 在 ARC-AGI 的测试报告。
OpenAI o3 在 ARC-AGI-Pub 上取得突破性高分
OpenAI 的新 o3 系统(在 ARC-AGI-1 公共训练集上进行训练)在我们公布的公共排行榜 10,000 美元计算限制下的半私人评估集上取得了突破性的75.7% 的成绩。高计算(172x)o3 配置得分为87.5%。
这是 AI 能力的惊人而重要的阶跃式增长,展现了 GPT 系列模型中前所未有的新任务适应能力。作为背景,ARC-AGI-1 用了 4 年时间从 2020 年 GPT-3 的 0% 上升到 2024 年 GPT-4o 的 5%。所有关于 AI 能力的直觉都需要针对 o3 进行更新。
ARC Prize 的使命超越了我们的第一个基准:成为 AGI 的北极星。我们很高兴明年能与 OpenAI 团队和其他团队合作,继续设计下一代持久的 AGI 基准。
ARC-AGI-2(相同格式 - 对人类来说很容易验证,对人工智能来说更难验证)将与 ARC Prize 2025 一起推出。我们致力于举办大奖赛,直到创造出得分达到 85% 的高效开源解决方案。
OpenAI o3 ARC-AGI 结果
我们针对两个 ARC-AGI 数据集测试了 o3:
半私密评估:用于评估过度拟合的 100 个私密任务
公开评估:400个公开任务
在 OpenAI 的指导下,我们在两个计算级别上进行了测试,样本大小可变:6(高效)和 1024(低效,172 倍计算)。
结果如下:
注意:o3高计算成本目前不可用,因为定价和功能可用性仍然是待定的。计算量大约是低计算配置的172倍。
关于“调整”的说明:OpenAI分享了他们训练我们测试的o3模型使用了公共训练集的75%。他们没有分享更多细节。我们还没有测试ARC-untrained模型,以了解性能有多少是由于ARC-AGI数据。
由于可变的推理预算,效率(例如,计算成本)现在成为报告性能时必须考虑的指标。我们已经记录了总成本和每个任务的成本,作为效率的初始代理。作为一个行业,我们需要找出哪个指标最能跟踪效率,但从方向上看,成本是一个可靠的起点。
高效率得分75.7%符合ARC-AGI-Pub的预算规则(成本<10,000美元),因此有资格在公共排行榜上排名第一!
低效率得分87.5%相当昂贵,但仍然表明,随着计算量的增加,对新任务的性能确实有所提高(至少在这个水平上)。
尽管每个任务的成本显著,但这些数字不仅仅是将蛮力计算应用于基准测试的结果。OpenAI的新o3模型代表了AI适应新任务能力的一次重大飞跃。这不仅仅是渐进式的改进,而是一个真正的突破,标志着与以往LLMs的局限性相比,AI能力发生了质的转变。o3是一个能够适应它以前从未遇到过的任务的系统,可以说在ARC-AGI领域接近人类水平的表现。
当然,这种普遍性的代价是高昂的,目前还不太经济:你可以支付一个人大约5美元来解决ARC-AGI任务(我们知道,我们做过),同时仅消耗几分钱的能源。与此同时,o3在低计算模式下每个任务需要17-20美元。但成本性能可能会在未来几个月和几年内显著提高,所以你应该计划这些能力在相当短的时间内与人类工作竞争。
o3相对于GPT系列的改进证明了架构是一切。你不能仅仅通过向GPT-4投入更多的计算就能获得这些结果。简单地从2019年到2023年扩大我们正在做的事情——采用相同的架构,训练一个更大的版本,使用更多的数据——是不够的。进一步的进展是关于新的想法。
那么它是 AGI 吗?
ARC-AGI作为一个关键的基准测试,对于检测这类突破至关重要,它以一种饱和或要求不高的基准测试无法做到的方式突出了泛化能力。然而,重要的是要注意,ARC-AGI并不是对通用人工智能(AGI)的酸性测试——正如我们今年重复了几十次的那样。它是一个研究工具,旨在集中注意力在人工智能中最具有挑战性的未解决问题上,在过去五年中,它很好地履行了这一角色。
通过ARC-AGI并不等于实现了AGI,实际上,我不认为o3已经是AGI了。o3在一些非常简单的任务上仍然失败,这表明它与人类智能有根本的不同。
此外,早期的数据点表明,即将到来的ARC-AGI-2基准测试对o3来说仍然是一个重大挑战,即使在高计算量下,也可能将其得分降低到30%以下(而一个聪明的人类在没有训练的情况下仍然能够得分超过95%)。这表明,我们仍然有可能创建具有挑战性、未饱和的基准测试,而不必依赖于专家领域知识。当创造对普通人类来说容易但对AI来说困难的任务变得根本不可能时,你就会知道AGI已经到来了。
o3 与之前的模型相比有何不同?
为什么o3的得分比o1高这么多?还有为什么o1的得分比GPT-4o高这么多?我认为这一系列结果为持续追求AGI提供了宝贵的数据点。
我对LLMs的心理模型是,它们作为一个向量程序的存储库。当提示时,它们会检索你的提示映射到的程序,并在手头的输入上“执行”它。LLMs是一种通过被动接触人类生成的内容来存储和操作化数百万有用小程序的方式。
这种“记忆、检索、应用”范式可以在给定适当的训练数据的情况下,在任意任务上达到任意技能水平,但它不能适应新奇事物或即时学习新技能(也就是说,这里没有流动智能的参与)。这一点在ARC-AGI上的低表现得到了体现,这是唯一专门设计用来衡量适应新奇事物能力的基准测试——GPT-3得分为0,GPT-4得分接近0,GPT-4o达到了5%。将这些模型扩展到可能的极限并没有使ARC-AGI的数字接近几年前基本的暴力枚举所能实现的水平(高达50%)。
要适应新奇事物,你需要两样东西。首先,你需要知识——一套可重用的函数或程序来借鉴。LLMs拥有足够的知识。其次,你需要在面对新任务时将这些函数重新组合成一个全新的程序——一个模拟手头任务的程序。程序合成。LLMs长期以来缺乏这个特性。o系列模型修复了这一点。
目前,我们只能推测o3的确切工作原理。但o3的核心机制似乎是在令牌空间内进行自然语言程序搜索和执行——在测试时,模型在可能的思考链(CoTs)空间中搜索,描述解决任务所需的步骤,这种方式可能与AlphaZero风格的蒙特卡洛树搜索不无相似。在o3的情况下,搜索可能由某种评估模型引导。值得注意的是,Demis Hassabis在2023年6月的一次采访中暗示DeepMind一直在研究这个想法——这项工作已经酝酿已久。
因此,虽然单一代LLMs在新奇事物上挣扎,o3通过生成和执行自己的程序克服了这一点,其中程序本身(CoT)成为知识重组的成果。虽然这不是测试时知识重组的唯一可行方法(你也可以进行测试时训练,或在潜在空间中搜索),但它代表了根据这些新的ARC-AGI数字,当前的最先进技术。
有效地,o3代表了一种深度学习引导的程序搜索。模型在“程序”空间(在这种情况下,自然语言程序——描述解决手头任务步骤的CoTs空间)进行测试时搜索,由深度学习先验(基础LLM)引导。解决单个ARC-AGI任务最终可能需要数千万美元和数千美元的成本,是因为这个搜索过程必须探索程序空间中的大量路径——包括回溯。
然而,这里发生的事情和我先前描述的“深度学习引导的程序搜索”作为达到AGI的最佳路径之间有两个显著的不同。关键的是,o3生成的程序是自然语言指令(由LLM“执行”),而不是可执行的符号程序。这意味着两件事。首先,它们不能通过执行和直接评估任务与现实接触——相反,它们必须通过另一个模型评估适应性,而评估,缺乏这种基础,可能在操作分布之外时出错。其次,系统不能自主获得生成和评估这些程序的能力(就像AlphaZero这样的系统可以自己学会玩棋盘游戏一样。)相反,它依赖于专家标记的、人类生成的CoT数据。
目前还不清楚新系统的确切局限性以及它能扩展多远。我们需要进一步测试来找出答案。无论如何,当前的性能代表了一项了不起的成就,并且清楚地证实了直觉引导的测试时程序空间搜索是一个强大的范式,可以构建能够适应任意任务的AI系统。
接下来是什么?
首先,由2025年ARC Prize竞赛促进的o3的开源复制对于推动研究社区向前发展至关重要。对o3的优势和局限性进行全面分析是必要的,以了解其扩展行为、潜在瓶颈的性质,并预测进一步发展可能解锁的能力。
此外,ARC-AGI-1现在已经饱和——除了o3的新得分外,事实上,一个大型的低计算量Kaggle解决方案现在可以在私有评估中获得81%的得分。
我们将通过一个新版本——ARC-AGI-2——来提高标准,这个版本自2022年以来一直在开发中。它承诺将重置最先进技术的状态。我们希望它通过艰难、高信号的评估来推动AGI研究的边界,突出当前AI的局限性。
我们对ARC-AGI-2的早期测试表明,它将是有用且极具挑战性的,即使是对o3也是如此。当然,ARC Prize的目标是产生一个高效率和开源的解决方案,以赢得大奖。我们目前计划在2025年ARC Prize(预计启动时间:第一季度末)同时推出ARC-AGI-2。
展望未来,ARC Prize基金会将继续创建新的基准测试,以集中研究人员的注意力在通往AGI的道路上最难解决的问题上。我们已经开始了第三代基准测试的工作,它完全脱离了2019年ARC-AGI的格式,并融入了一些令人兴奋的新想法。
参与:开源分析
今天,我们还将发布高计算量 o3 测试的数据(结果、尝试和提示),并希望您能帮助我们分析结果。特别是,我们非常好奇约 9% 的公共评估任务 o3 无法解决,即使需要大量计算,但对于人类来说却很简单。
我们邀请社区帮助我们评估已解决和未解决的任务的特征。为了激发您的想法,这里有 3 个高计算 o3 未解决的任务示例。
全套 o3 测试数据:
https://github.com/arcprizeorg/model_baseline/tree/main/results
这是测试中使用的 Prompt:
https://github.com/arcprizeorg/model_baseline/blob/main/prompt_example_o3.md
结论
总结一下,o3 代表了一次重大飞跃。它在 ARC-AGI 上的表现凸显了适应性和泛化方面的真正突破,这是其他任何基准都无法如此明确地体现出来的。
o3 解决了 LLM 范式的根本限制,无法在测试时重新组合知识,它通过 LLM 引导的自然语言程序搜索来实现这一点。这不仅仅是渐进式的进步;这是一个新领域,需要认真的科学关注。
关注公众号,用极客视角洞察未来!
往期精彩文章推荐: