《量子杂志》长文解读:一万个 agent,88 小时,3000 亿 token,攻克悬置 90 年的千禧年大奖难题
今天最大的ai 新闻是OpenAI 用一万个 agent,运行在内部模型上,88 小时破解了千禧年难题。但是故事背后的人类英雄,是两个直到相当晚近都还在公开说自己不用 ai 的数学家。
一方面是数学难题抽象复杂,另一方面是涉及到多方争议,《量子杂志》用一篇长文讲清楚了别后的来龙去脉,是关于这一事件最值得读的好文章之一。
分享要点总结:
【一万个 agent 做了什么】
2026 年 9 月 8 日上午,openai 的数学家宣布,一万个自主 agent 在他们的指挥下、运行在一个未对公众开放的内部模型上,找到了三维纳维-斯托克斯方程的一个奇点,解决了 2000 年克雷数学研究所提出的六个未决千禧年大奖难题之一,每个悬赏一百万美元。结果已经用 lean 完成形式化验证。
openai 的新闻稿里,第一步是将近 100 个 agent 协作约 50 小时,产出欧拉正则性的反证。随后规模拉到一万个左右去攻纳维-斯托克斯,88 小时后拿到奇点证明,再花 17 小时由另一个模型完成形式化。整个过程 agent 之间互发了将近 500 万条消息,sébastien bubeck 估计算力成本在几百万美元量级。
抢先 12 小时宣布的是另一边。纽约大学的 tristan buckmaster 与 anthropic 的 levent alpöge,借助包括 openai 在内的多种模型解决了若干密切相关的问题。openai 承认自己这轮攻纳维-斯托克斯正是被一则传言激发的,而传言里的两人其实还差一点,他们手上是一个未经验证、针对稍微容易一些版本的爆破证明。
【这个问题难在哪】
纳维-斯托克斯方程用牛顿第二定律描述流体行为,19 世纪中叶写下,悬而未决的是解是否永远行为良好,还是可以演化到某个无穷小的流体部分以无限快的速度流动,也就是奇点。这类结果没有任何直接的实践后果,方程假定你能对流体无限放大,真实流体却由分子和原子构成。它重要恰恰因为这样的奇点即使只在理想化意义上存在,本身也出人意料:湍流比它看起来还要古怪。
想拿走那一百万,奇点必须发生在向各个方向无限延伸的三维空间里,而不是像 2013 年那类结果那样预设一个边界;驱动流体的受迫函数还必须是光滑的,不能靠别扭笨拙的力硬把流体逼出奇怪举动。fefferman 的理由是,有边界时你只能说明流体靠与边界的相互作用形成奇点,没有边界,才是流体自己在干疯狂的事。
【真正的思想主角】
两条 ai 路线都重度依赖马德里的两位数学家,diego córdoba 和他的学生 luis martínez-zoroa。后者在 2021 年的博士论文里开创了完全不依赖计算机的解析技术,与 2013 年以来计算机辅助的主流方式分道扬镳,两人因此成了这个领域的怪人。撰写克雷研究所官方问题描述的 charles fefferman 说,故事的英雄是他们两人。
这套技术构造一个无穷的层序列,每一层都是所研究方程的一个非奇异解,再按无穷级联的方式组合成新解。新解含有想要的奇点,麻烦在于每层单独依赖的都是光滑受迫函数,组合到一起却让受迫函数具有不良的数学性质。2023 年那个欧拉方程版本正是因为这条,卡在千禧年判据之外。
剩下那道坎因此被精确定义了出来:造一个类似的级联,既产生奇点,又保持受迫函数光滑。这一步正是两个互相竞争的 ai 团队看上去都做成的地方。ai 补上的是最后一块工程性拼图,不是整条思路。
córdoba 爱开的玩笑是「我不用 ai:我有 luis」。martínez-zoroa 补充说两人都不是反对 ai,只是直到相当晚近,它和自己的工作流配合得并不好。被 ai 补完的,恰恰是这条骄傲地不用 ai 的路线。
【确定性的边界与一地鸡毛】
lean 能以密不透风的确定性确立一个陈述必然为真,但确定性有边界。仍然必须由人类完成的那个环节,是保证在 lean 里被证明为真的陈述,与数学家原本想证明的东西逻辑等价。机器保证推理无误,人保证问的是对的问题。
正确和可读是两件事。buckmaster 说,同伴发给他的第一个 llm 生成的证明「是我读过的最可怕的东西」。因为进展走漏到 openai,两人被迫提前时间表,发布的三篇论文里有一篇被他自己称作「ai 垃圾稿」,并为此道歉。
openai 把三维欧拉的优先权让给 buckmaster 和 alpöge,同时为纳维-斯托克斯主张优先权。而 buckmaster 在声明中似乎暗示,openai 的研究者或他们的 agent,可能接触到并受益于他和 alpöge 使用 openai 模型做出的工作。同一批模型同时服务竞争双方,这个结构本身就让谁受益于谁很难说清。
buckmaster 把私下对同事说过的话摆到了明面上:鉴于这一整体工作,luis martínez-zoroa 配得上一枚菲尔兹奖。
今日份高质量信息流
今日份的《AI 内参》已更新,请查收。先推荐几篇:
Anthropic:如何降低 Claude 成本而不牺牲效果
https://ai.candobear.com/neican/articles/3d6679b1-08ff-817e-9b23-eb8b31ba4784
今天最能直接变成动作的一篇:prompt cache 命中率、清理旧提示词反模式、按任务校准 effort,三条都写进了 claude-api skill。
《量子杂志》:如何组织一万个 agent 攻破千禧年难题
https://ai.candobear.com/neican/articles/3d6679b1-08ff-8154-b480-c43c036c9322
今天的主题事件,看这一篇就够:它把 OpenAI 公告、方法和数学界的反应放一起讲,重点是「一万个 agent 在人的指导下工作」这个组织形态,比结果本身更值得你从「怎么用 agent 干活」的角度琢磨。如果想追争议,再补陶哲轩那篇。
Stratechery:写下来这件事,对人和 AI 一样有用
https://ai.candobear.com/neican/articles/3d6679b1-08ff-811b-b7ae-fd30ebe46228
和费曼笔记、第二大脑一脉相承,Ben Thompson 讲的不是「写作有用」,而是写什么、为什么写、怎么做完。适合作为今天费曼笔记的素材。
The Information:Anthropic 十一个月签下 5170 亿美元算力合同
https://ai.candobear.com/neican/articles/3d6679b1-08ff-81dc-885e-d6554846444f
投资视角必读。Claude Code 和 Cowork 需求超预期倒逼算力采购,这个数字是理解今年 AI 基建节奏的锚点;配合 SemiAnalysis 那篇 TPU 对外开放,能拼出 Google 与 Nvidia 在推理成本上的竞争格局。
全部内容:
点击“阅读原文”,直接体验AI 内参。微信登录,每天领取积分,可以兑换内参,免费阅读。