AI已经卷到梦境了,它们在梦中学会玩《我的世界》
屏幕里,棕褐色与绿色方块堆叠而成的树木遮天蔽日,挡住了全部视野。“我”拨开周围的树叶,跳到更高处,用力捶向另一棵树的树干。沿着这片广袤林地向前,很快,“我”采集到了十几块木材。打开背包,“我”用木材一步步合成木板、木棍、工作台,又在工作台上造出了第一把工具木镐,终于可以开启向地下深处探索的挖矿之旅了!
随着采集的材料越来越坚硬,“我”合成的工具也从木镐,替换为石镐乃至铁镐。“我”一刻不停地在幽暗矿道里摸索着,终于在20多分钟后收集到了第一颗钻石。看上去,这只是一个平平无奇的《我的世界》(Minecraft,沙盒类电子游戏)实况视频:在开放的马赛克世界中,玩家以第一人称视角记录了自己从一无所有到采集钻石的全过程。然而,这一视频的发布却引起了极大的震撼,所谓“玩家”其实是由谷歌深度思维(Google DeepMind)公司开发的智能体(agent)——“梦想家4”(Dreamer 4)。
在《我的世界》中,钻石是一种稀缺资源,对人类玩家而言,采集钻石绝非易事。与视频演示的一样,我们需要明确目标,收集材料,制造工具,根据地况调整挖矿路线,并时刻关注周围环境和自身的状态。这是一个漫长的过程,任何环节出错——比如没用合适的工具挖钻石矿,或不小心跌入岩浆——都可能导致此前的努力归零。
人类之所以能完成这类长线规划的任务,是因为我们拥有极为特殊的直觉与预测能力。当我们看到一片马赛克森林,我们感知到的不仅仅是像素块,还有潜在的可能:砍伐树木可以获得木材资源,木材可用于制造工具,进而可以向地下挖掘矿藏。这种超越当下感官的理解能力,本质上是我们对《我的世界》运行规则的认知投射。
我们如何认识世界
从像素世界回归现实,这种认知投射的规律依然适用。当我们接收到感官信息,比如看到人行道上的红灯,大脑立刻会推断“再过几十秒,红灯会变绿”,继而作出“等一会再走过马路”的规划。为什么我们能快速、准确地作出因果判断,而无需在现实中尝试更多的可能?
20世纪中叶,苏格兰心理学家、认知科学的先驱之一肯尼斯·克雷克(Kenneth Craik)提出了一种解释:生物体的大脑会根据外部现实创建一个个小规模模型,这些模型允许生物在实际行动前,先在脑海中预演可能发生的各种情况。在后续发展中,这一理念不断演化。1971年,系统动力学之父杰伊·赖特·福雷斯特(Jay Wright Forrester)提出的“心理模型”(mental model)概念,将其描述为我们内部对世界的一种抽象表征。
它并不精确,只由一些概念及其相互关系构成,还会随时间、环境等各种因素改变。
心理模型这一假设,本质上在尝试解释智能究竟如何理解世界,从而实现精准的预测、规划和行为控制,而这刚好与人工智能(AI)科学家的目标不谋而合。在1990年的一篇论文中,德国计算机科学家、现任沙特阿拉伯国王阿卜杜拉科技大学生成式人工智能中心联合主席的尤根·施密德胡伯(Jürgen Schmidhuber)首次提出了“世界模型”(world model)一词,它负责学习世界的因果规律,预测行为的后果。
在施密德胡伯的构想中,世界模型与另一个“控制器”模型相互结合,再引入内部相互竞争的奖励机制,即“人工好奇心”,共同构成一个“人工科学家”框架。这项工作的初衷源于施密德胡伯从少年时期开始的一个梦想:他希望构建一个能像科学家一样探索世界、做实验、学习物理规律,并用这些知识解决问题的系统,最终,这个人工科学家会比他自己还聪明。“这样我就可以退休了,”施密德胡伯接受《环球科学》采访时畅想道。
在算力昂贵而稀缺的20世纪90年代,这番构想显得异想天开,甚至有些不切实际。之后,施密德胡伯又提出了长短期记忆网络(LSTM,RNN的一种)等影响深远的框架,但世界模型这个概念当时并没有掀起水花,很快就归于沉寂,消失在学界主流视野之外。
世界模型的文艺复兴
时过境迁,进入21世纪10年代,GPU算力飞速飙升,深度学习重新点燃了神经网络的潜力。近几年,大语言模型(LLM)的崛起更是改写了所有人对AI能力边界的想象:AI似乎已经具备了某种“理解”能力。当AI开始走入普通人的日常生活,“通用人工智能(AGI)是否即将到来”不再只是学术领域的辩题,也成为一种普遍的社会期待。
但越是与这些模型长期相处,研究者越能清楚地意识到,这种希望也许过于乐观。大模型的“智慧”建立在统计关联之上,它们能流畅地复述,却不代表真正理解世界,因此它们会在看似简单的物理常识上犯错,会在需要长程规划和因果推理的任务中迷失方向,也很难解释自己为什么生成某个答案。
面对这样的瓶颈,一些研究者相信“大规模出奇迹”。通过不断收集训练数据、扩增模型参数规模,或许就能让一些模型像LLM一样“涌现出理解”,彻底解决现在的弊病。另一些科学家则认为,这大概率是一条成本高昂却收效甚微的死路:高质量的互联网文本数据已快被用尽;神经网络的黑箱问题导致其可解释性依然很差。解决这些问题的答案或许就藏在“如何让AI真正理解世界”中。
在这样的背景下,施密德胡伯早年的设想重回AI研究的焦点,甚至一举回归最前沿的方向。在他与计算机科学家戴维·哈(David Ha)2018年合作发表的《世界模型》(World Model)一文中,他们提出了一个包含视觉、记忆与控制模块的简洁框架,并展示了这个模型如何在游戏环境里支持长程规划与决策。这在当时的研究社区引起了广泛关注。许多人意识到,AI也能在内部构建一个可供试验的世界,在行动之前先行预演,而不仅仅是被动地反应。
然而,“世界模型”重新成为AI领域的热词时,并不是以标准而清晰的定义回归的。正如美国斯坦福大学计算机科学系助理教授吴佳俊所言,这是一个“极易传播、却未经严格定义”的概念。做三维重建的人可能用它来指代空间结构建模,做多模态理解的人则强调抽象空间中的表示和预测能力,而做具身智能的人更关心模型与现实世界的物理交互。
不同背景的研究者怀揣着不同的问题和愿景,不约而同地借用了“世界模型”一词,这背后既有“理解世界”的共识,也暗藏着“什么才算真正理解世界”的争论。
在梦中学习
对于梦想家系列的核心开发者、谷歌深度思维的AI研究员达尼贾尔·哈夫纳(Danijar Hafner)而言,世界模型指向了非常具体的问题:当智能体做出某一行动,周围环境会如何根据行动作出反应?这种想法源于人类自身的行为规律。我们做任何事情都不会盲目乱试,而是会先在脑内预演、规划,再实际行动。
为了能在真实世界中可靠地行动,智能体同样需要理解当前的现状,更需要预测未来可能会发生什么,再决定如何行动。在哈夫纳看来,世界模型的核心用途就是“感知世界”与“预演行动”。
直觉上,如果给智能体内置一个世界模型,用来模拟现实世界的运行规律,它就能像人类一样,在采取行动前,先在内部世界中预演行动,而不必在现实中大量试错。这种基于模型的强化学习(model-based reinforcement learning,MBRL),要比无模型的方法高效得多。不过,许多研究员都曾劝哈夫纳:“别在MBRL上浪费时间了,很多人都试过,我们就是搞不定。”但哈夫纳并不甘心放弃如此符合人类直觉的学习方式。
最终,他们搭建起梦想家系列“在梦中学习”的核心架构:让智能体先通过少量真实的交互数据构建内部模型,随后深入到潜空间“梦境世界”,生成成千上万条可能的未来轨迹,其中既包含成功的,也包含走几步就失败的、走到最后一步失败的等等。它就像一名在赛前反复思考、规划动作的运动员,将昂贵的现实试错,转移到了廉价且高速的内部模拟中。
起初,梦想家1仅仅只是跑通这一框架,但性能完全无法与无模型的强化学习(model-free reinforcement learning,比如AlphaGo就是用这种方法训练的)相媲美。经过哈夫纳和同事的不断打磨,2025年4月发表在《自然》(Nature)上的梦想家3,在超过150项任务(包括在《我的世界》里挖钻石)上的表现均已超越无模型的强化学习。
研究团队还展示了梦想家3的突出表现:在完全未知的《我的世界》游戏环境里,智能体仅凭自身经验,从一无所有,到经历了上万次没有即时奖励的步骤,最终首次挖出了稀缺的钻石。而且和人类一样,它并没有在游戏中暴力试错,而是靠在自己的内部世界中反复“预演”未来。
但与《我的世界》相比,真实世界要复杂得多。为了让世界模型能处理复杂、多样、规模更大的真实世界数据集,哈夫纳和团队在2025年9月发布的梦想家4中彻底更换了原有架构。
与此前需要环境反馈来纠正世界模型的梦想家模型相比,梦想家4完全基于人类数据学习,无需在环境中进行任何训练。在哈夫纳发布的演示视频里,梦想家4在高清视频环境中,通过“操纵”键盘和鼠标完成了在《我的世界》中采集钻石的任务,就像人类一样。
如何才算理解世界?
深度思维团队开发的梦想家系列更关注“如何更好地在世界中行动”,但还有一部分生成式世界模型研究者,他们关注另一个看似更基础的问题:世界到底长什么样?对于他们而言,“世界”在某种程度上等同于能被“像素级还原”的连续画面。
2024年初,OpenAI公司发布了视频生成模型Sora。不少观看者产生了一种错觉:Sora不只是在拼贴画面,更像是在一个内部世界里拍摄视频。OpenAI甚至直接称这类视频生成模型为“世界模拟器”(world simulators)。这其中似乎隐含着“生成即理解”的信念:如果能生成无限逼近现实的视频图像,意味着模型能稳定预测下一帧画面的每一个像素,物理规律自然会从中涌现。
“这些视频模型确实令人印象深刻,它们非常通用,理解能力也不错,”哈夫纳表示,“但主要问题是,它们生成预测的速度实在太慢了,并不适合作为智能体。”而更重要的一点是,它们并没有完全理解物理。
与哈夫纳的质疑相比,法国计算机科学家、图灵奖得主杨立昆(Yann LeCun)的批判则锋利得多。他曾多次公开表示,通过像素生成来理解世界,是一条注定低效、甚至可能走不通的路。他认为,与其让模型去复现或模拟世界,不如去压缩、提炼并预测世界的抽象结构。这种“表征学习”(representation learning)方法能天然过滤掉那些无关紧要的细节,专注于预测重要的表征。
另一些科学家并不否认生成式AI的强大,但若想让它们“理解世界”,发展为更准确的世界模型,或许需要关注如何解决AI的一个根本性困境:感知能力强,但推理能力极弱。
比如,一个经过训练的神经网络能轻易识别出图片中有一个“红色的球”,但它是否真正理解“红色”这一颜色属性、“球”这一几何概念,以及它们背后隐含的质量、弹性等物理性质?在神经网络中,这些所谓的“属性”往往只是一堆高维向量的统计相关性,而不是可以被操纵、组合甚至推理的概念。
这种感知与推理上的分裂,给科学家带来了极为现实的困扰:当AI出错时,我们根本不知道它错在哪里。是识别出错了,理解过程错了,还是推理阶段错了?为了理清这团混沌,我们需要为善于感知世界的神经网络加入理性的骨架——擅长推理和逻辑运算的符号主义。这是吴佳俊团队主要关注的方向之一:神经符号推理(Neuro-Symbolic AI)。
“我们需要从连续的神经网络表示中提取出这些离散的符号概念,”吴佳俊解释道,“一方面,这能帮我们理解神经网络这个黑盒模型在干什么,另一方面,借助大模型的强大能力,我们或许能从数据中蒸馏出新的结构或公式,继而发现新的科学规律。”
然而,无论屏幕里的模型优化得有多完美,无论它们以何种方式“理解”物理,最终都要走入现实世界这个终极考场,从理解世界到与世界互动。
在施密德胡伯的世界观中,世界模型只是理解世界的第一步,如果机器人能学会使用工具与自我复制,一切都将迎来改变。他轻松而梦幻地畅想道:“想象一下,未来的机器人将拥有超越人类的认知,它将不知疲倦地重塑物理世界,为人类创造数不尽的财富,从而让人类从繁重无趣的劳动中彻底解放。机器人将发展出独立、自我完善的文明,在好奇心的驱动下,飞向太阳系的边缘,探索广袤的宇宙,或许能解开那些困扰我们千年的宇宙谜题。”
世界并不“干净”,它是潮湿、粗糙、充满噪声和意外事件的状态空间。而正是在这样的混沌中,人类用一颗仅有1.35千克重的大脑,学会了生存、劳动、协作与玩乐。对人类而言,理解世界往往是无意识的过程,我们无需了解空气动力学,也能挥拍击中羽毛球;无需实验演示,也能理解复杂的科学概念。这些对人类轻而易举的预判、理解等认知能力,对于机器却异常艰难。构建世界模型,既是实现具身智能的终极方案之一,也是对理解人类思考过程的追求。
本文节选自《环球科学》2026年2月刊《当AI开始理解世界》一文。
本文来自微信公众号“环球科学”。如需转载,请在“环球科学”后台回复“转载”,还可通过公众号菜单、发送邮件到[email protected]与我们取得联系。相关内容禁止用于营销宣传。
-电商广告-
《环球科学》2026年2月新刊销售中
戳图片或阅读原文
立即购买