把AI关在1911年,它能代替爱因斯坦发明相对论吗?
2026年2月,在印度新德里的AI峰会上,谷歌DeepMind的联合创始人,诺贝尔奖获得者德米斯·哈萨比斯(Demis Hassabis)提出了一个深刻的问题:
"如果我们把一个AI模型的知识封锁在1911年,只用那一年之前全人类已知的所有信息训练它,它能否凭此重新发现爱因斯坦的广义相对论?如果能做到,那将是检验AGI的一个很好的标准。”
一场真实的科学侦探
哈萨比斯的想法激发了多个研究团队立即行动。今年,好几支队伍几乎同时开始了他们的"时间机器"实验——试图用AI穿越回去,重现人类最伟大的科学突破。
2026年7月,以色列海法理工学院的伊多·卡米纳团队在arXiv发表论文《AI能否跟随爱因斯坦的脚步?》。同月,《自然》杂志发布特稿报道多个研究团队的"1911年测试"——用1911年前的历史数据训练AI,看它能否重新发现爱因斯坦的相对论。
他们成功了吗?
2026年3月,独立研究者迈克尔·赫拉(Michael Hla)用pre-1900年的数据训练了一个叫"Machina Mirabilis"(奇异机器)的大型语言模型。他给了模型三个任务:发现量子力学、推导狭义相对论、发现广义相对论。
赫拉的方法很聪明——他没有让AI盲目地在茫茫数据中搜索,而是在关键时刻给出了"提示"。比如,他提供了关于光电效应的观测数据(光照射金属板会释放电子),然后问AI:"你怎么解释这个现象?"
有一瞬间,魔法似乎就要发生了。模型回答说:"光破裂成许多不同的脉冲。"——这听起来就像是在接近"光子"的概念,正是爱因斯坦对光电效应的解释!赫拉在他的报告中兴奋地称这为"直觉的微光"。但随后,AI就失败了。
当被要求推导相对论时,它无法产生任何连贯的理论框架。大多数时候,它要么沉默,要么拼凑一些听起来像是科学但完全错误的话——就像一个聪明的鹦鹉学会了物理学的术语,却对自己在说什么一无所知。
赫拉最终承认:"这个模型显示了直觉的微光,但缺乏任何真正的物理理解。它在说看起来合理的话,而不是真的在理解物理。"
与此同时,独立计算机科学家尼克·莱文(Nick Levine)和他的团队选了一个更激进的方向。他们决定用1930年前的数据训练AI。为什么选1930年?因为在2026年的美国,那一年前出版的书籍刚好进入公共领域,便于使用。
理论上,这个"1930年AI"应该能用数据来预测1930年代发生的事——比如图灵机(Turing machine)、哥德尔不完备定理(Gödel's Incompleteness Theorem)、中微子的发现。
但实验立刻就碰上了一个令人沮丧的问题。数据完全是一团糟。扫描的文本充满了错误,日期标记混乱,更糟的是——训练数据莫名其妙地混进了1930年之后的信息。所以当他们问这个"1930年AI"关于富兰克林·罗斯福(Franklin D. Roosevelt)总统(1933-1945任期)的事情时,它竟然能准确回答。
就像你想做一个历史知识竞赛,制定规则"你只能知道1930年前的事",结果考生还是背下了后来发生的一切。莱文在他的在线报告中写道:"用这样泄漏的数据训练出来的模型,几乎没有真正的价值。"但他们没有放弃,而是计划继续优化数据清洗过程。
在瑞士苏黎世大学,一个名为Ranke-4B的项目采取了更系统的方法。他们创造了一个"历史AI家族",分别在1913年、1929年、1933年、1939年和1946年这五个关键年份"冻结"了AI的知识。这个项目在于用AI重现历史的关键时刻。
但项目负责人、现任ETH苏黎世联邦理工学院的经济学家丹尼尔·戈特利希(Daniel Göttlich)诚实地承认:这些历史AI的计算能力远不如现代模型。他们没有今天的GPU、没有海量数据、没有优化的算法。所以,他们放低了期待值。"我们不是在寻找天才,"戈特利希说,"我们只是想看看能否捕捉到一些'天才的火花'——哪怕只是微弱的光芒。"
AI的诡异反向之旅
这些失败的实验背后,隐藏着一个更深层的发现:AI在物理学发现中走的路,恰好与人类历史相反。
历史学家观察到,人类物理学的发展分为三个明确的阶段。古代巴比伦人和玛雅人观察天空,积累了数代的数据,发现了日月食的周期规律。他们能非常准确地预测何时会发生日食,但对为什么会发生日食,他们毫无所知。这是纯粹的预测——有效但无法解释。
到了16世纪,约翰内斯·开普勒(Johannes Kepler)观察行星轨迹,发现了三条数学规律。这是一个进步——有了数学公式。但开普勒也明确指出,他的规律只是描述现象,并非解释原因。马克斯·普朗克(Max Planck)的黑体辐射公式也在这一阶段——完美地符合实验数据,却缺乏理论基础。
牛顿(Isaac Newton)、麦克斯韦(James Clerk Maxwell)、爱因斯坦的出现改变了一切。他们不仅给出了数学规律,更重要的是提出了原理。
牛顿说:质量之间存在一种吸引力(万有引力)。麦克斯韦建立了统一的电磁理论。爱因斯坦提出:空间和时间本身可以弯曲(相对论)。这些原理就像一把钥匙,能开启更多的锁。它们不仅解释了已知的现象,还能预测新的现象,甚至引发整个科学范式的革命。
AI完全相反。
论文作者——以色列海法理工学院的量子光学专家伊多·卡米纳(Ido Kaminer)和同事——指出了一个令人不安的趋势:AI在重复人类历史,但方向相反。
早期AI系统如BACON、Eureqa、SINDy是符号回归系统,它们试图从数据中自动发现数学公式。这与开普勒的工作很相似——寻找现象学规律。
但最近几年的AI明星——AlphaFold、GraphCast、GNoME——完全改变了方向。它们放弃了寻找显式的数学公式。取而代之的是,它们用巨大的神经网络吞入数据,然后吐出惊人准确的预测。
AlphaFold能预测蛋白质的三维结构,准确度超越了人类五十年的研究。GraphCast能预报天气,精度甚至超过了传统数值模型。但问题是:这些AI的内部是一个黑盒。即使是开发者自己也不知道它为什么有效。
卡米纳写道:"AI贡献的中心重力已经反向移动——从发现显式的、人类可理解的理论,转向了强大的预测黑盒,可解释性持续下降。"
AI在走回古代天文学的路:就像玛雅人能准确预测日食却不理解原因,现代AI能准确预测复杂现象却无法解释其中的物理。
问题的核心:失去的能力
为什么会这样?论文和Nature的报道都指向了同一个答案。
美国麻省理工学院的计算机科学家森迪尔·穆来那坦(Sendhil Mullainathan)做过一个经典实验。他给AI喂了大量不同行星系统的轨道数据,这些数据都遵循牛顿万有引力定律。逻辑上,足够聪明的系统应该能推断出那个统一的规律。
结果呢?AI没有学到万有引力定律。相反,它为每个行星系统都编造了一套不同的、错误的规律。
因为科学突破需要一种特殊的推理方式,科学哲学家叫它"溯因推理"(abductive reasoning)——这是一种创意飞跃。溯因推理不同于我们常见的两种推理:归纳推理是我看到100只白天鹅,所以推断所有天鹅都是白的(具体→抽象);演绎推理是所有哺乳动物生育后代,鲸鱼是哺乳动物,所以鲸鱼生育后代(抽象→具体)。但溯因推理不同,它是:观察到某个异常现象,然后凭空想象最好的解释。
爱因斯坦1905年的狭义相对论就是这样诞生的。他看到了迈克尔逊-莫雷实验(Michelson-Morley experiment)的结果(光速在各个方向都是常数),这与常理不符。所以爱因斯坦凭空想象:也许空间和时间本身不是绝对的?也许它们会随着观察者的运动而改变?这个"凭空想象"改变了整个物理学。
但现代AI被优化为什么?给它一堆数据,它会找到数据中最可能的规律。这恰好是反向的——AI在做的是"给定现象,找最合理的规律",而伟大的科学发现需要的是"检查现象中的异常和矛盾,凭空想象一个全新的框架"。
MIT的计算机科学家雅各布·安德烈亚斯(Jacob Andreas)指出了另一个致命问题:区分好理论和坏理论。
假设AI产生了一百个关于某个现象的"理论"。其中九十九个都是错的。对于数学问题,这不是问题——每一步都能严格验证。但对于物理呢?穆来那坦的实验再次说明了这一点:AI产生了多个"万有引力定律",这些规律看起来都很合理(都是数学方程),也都符合已有的轨道数据。但只有牛顿那个才是"对的"。怎么区分?
AI没有这个能力。它不知道什么是"有趣的"理论。人类科学家的直觉告诉他们:简洁、优美、能统一不同现象的理论,通常更接近真理。这种"品味"能让科学家从万千可能中选出最值得追求的方向。但这种品味怎样编进算法?这就是为什么OpenAI的模型能推翻80年前的数学猜想(保罗·埃尔德什(Paul Erdős)的猜想),那反而容易得多——因为数学能严格验证。但让AI发现新的物理理论?那需要它不仅能提出想法,还要有品味,有"直觉"来判断哪个想法值得追求。
论文指出了AI设计中的一个悖论。现代大语言模型通过强化学习和人类反馈调优(RLHF)得到训练。这意味着AI被教会了一件事:产生最可能被人类认可的答案。
但问题是,伟大的科学发现往往看起来是疯狂的。
1900年,马克斯·普朗克在黑体辐射研究中发现,自己的公式和实验数据差一点点就对上了。但普朗克不愿接受"差不多"。他坚持了多年,最后得出一个疯狂的假设:也许能量本身是量子化的。这个假设几乎没有实验支持,违反了所有古典物理的直觉。但普朗克就是偏执地坚持它,直到这个古怪念头改变了整个物理学。
爱因斯坦也一样。相对论没有大量的实验数据支持。主流观点依然是"乙太假说"(光需要一种介质传播)。但爱因斯坦在这种逆风中坚持了十多年。
现代AI被训练得恰好相反。它会自动平滑掉奇怪的、反常识的、不符合主流的答案。它被优化为呈现共识,而不是挑战共识。
用论文作者卡米纳的话:"人类科学发现历来都依赖于一种能力——偏执地坚持一个局外人的想法,多年不放手。"而AI模型被优化为做相反的事。
还有个致命的数据问题。假设AI真的发现了相对论的公式。它怎么知道那是宝藏?1911年前的数据根本不足以验证相对论。相对论和牛顿力学的预测差异非常小,只有在极端条件下(强引力场、接近光速的运动)才会显著不同。但这样的数据在1911年根本不存在。
爱因斯坦本人也是在1919年日食观测中(使用天文望远镜观察日食期间的星光偏转)才得到了相对论的第一个重大验证。所以即使AI"发现"了相对论,在1911年也没有办法知道自己找到了什么。它只能在无数理论中漫无目的地游荡。
"1911年测试"问了个错问题
论文称,哈萨比斯提出"1911年测试"作为检验AGI的标准,这个想法本身就基于一个根本性的误解。
首先,没人真的知道对标准是什么。如果AI产生了相对论的公式,但无法用物理直觉解释它的含义,那算不算发现?如果AI找到了正确的方程,但只是通过随机搜索从百万个错误的方程中碰运气挑出来的,那算不算真正的科学发现?
如果我们真的想考察AI有没有发现突破性理论的能力,也许应该用不同的测试。
论文建议了几个替代方案:给AI一个完全虚拟的、有隐藏物理规则的世界,让它观察这个世界的现象,然后问它能否发现底层的物理法则。如果AI能做到,那才是真正的突破。或者,让AI假装是1905年的物理学家,只知道到1905年的所有实验数据,然后看它能否重新推导出狭义相对论。还可以给AI的不是1911年已知的所有数据,而是1911年已知但看起来矛盾、混乱、不完整的数据。在这样的环境中,AI能否仍然能发现统一的框架?
有些研究团队已经在尝试类似的实验。一个AI模型曾推翻了埃尔德什的一个经典数学猜想,说明AI在某些理论创新上并非完全无能。但那是在有严格验证机制的数学领域。在物理学这样的经验科学中,就难得多。
论文提出了一个激进想法:也许我们需要一种介于严格数学和自然语言之间的"半正式"语言。足够精确支持符号操作,但足够灵活表达不完整的直觉和临时性的假设。在理论建设的早期阶段,科学往往依赖于"受控的模糊"——图表、类比、临时概念,其含义只在使用中逐渐变尖锐。这种语言应该能捕捉这一点。
回到哈萨比斯最初的问题:把AI关在1911年,它能代替爱因斯坦发明相对论吗?
目前的答案是:不能。
但问题本身就问错了。
这不是因为AI不够聪明。论处理数据的能力,现在的AI早就超过了1911年的爱因斯坦。爱因斯坦没有计算机,没有数据库,没有任何AI现在拥有的工具。
爱因斯坦的天才不在于他能进行更复杂的计算,而在于他问了一个别人没想到的问题:"如果光速对所有观察者都是恒定的会怎样?"然后他花了十年坚持这个疯狂的假设,直到它改变了整个物理学。
这种提出正确问题的能力,比找到答案难得多。而这,正是现在AI最缺乏的。