谷歌推出第三代世界模型Genie 3(内附演示图):一句话秒生世界
文|晓静
编辑|郑可君
北京时间8月6日,谷歌正式发布Genie 3,这是一款通用型世界模型,能够生成前所未有的多样化交互式环境。
Genie 3是首个支持实时交互的世界模型,用户只需输入文本提示,Genie 3就能以每秒24帧的速度实时生成可供自由探索的动态世界,并在720p分辨率下保持数分钟的画面一致性。
相较于前两代产品,它不仅能在720p、24 fps的规格下即时生成可交互的三维场景,还把单次交互时长从几十秒延长到数分钟,并首次加入“可提示的世界事件”和“视觉记忆”等关键特性,使得同一房间里的涂鸦、家具位置等细节在玩家多次往返时依然保持一致,真实感大幅提升。
世界模型与 Genie 系列的定位
在 DeepMind研究路线图中,“世界模型”是迈向通用人工智能(AGI)的重要阶梯:通过学习环境的时空动态,它们不仅预测未来状态,还能评估自身行动的后果。
自 2023 年第一代 Genie 提出“从互联网视频无监督学习”的思路后,DeepMind 持续迭代:Genie 2 把场景从二维扩展到浅三维,并支持简单交互;如今的 Genie 3 则进一步提升分辨率、帧率与交互时长,为“可持续探索的沉浸式世界”奠定基础。
图片制作:腾讯科技
三大核心升级
1、 高清实时生成:
可输出 720p、24fps,可在消费级显卡上边生成边游玩,画面流畅度媲美传统游戏引擎。
要在 Genie 3 中实现高度可控的实时交互,必须攻克一系列关键技术难题。模型在自回归地生成每一帧画面时,需要随时间推移不停地参考先前已生成的整段“轨迹”。举例来说,若用户在一分钟后返回某个地点,模型就得调取并利用一分钟前的相关信息。为了真正做到实时互动,这一计算过程必须在新指令到来时,每秒重复执行多次。
2、 视觉记忆与一致性:
模型为场景要素建立持久隐变量:玩家回头再看墙上的涂鸦或桌上的纸条,内容不会随重绘而消失,解决了早期版本“转身即刷新”的沉浸感断裂。Genie 3模型可以在每秒多次生成帧的同时,回溯并利用最长可达 1 分钟的历史信息,确保环境连贯。
根据官方介绍,Genie 3 的一致性是一种涌现能力。其他方法(如 NeRF 和 Gaussian Splatting)同样能提供可导航的一致 3D 环境,但它们依赖预先给出的显式 3D 表示。相比之下,Genie 3 的世界根据场景描述和用户操作逐帧生成,因而更加动态、丰富。
就好像你在拍一部动画片:如果使用其它技术(NeRF、Gaussian Splatting),就像先搭好一座很精细的 3D 场景模型——房子、树木、灯光全都预先建好、摆好,再让摄像机在里面转来转去取景。因为场景事先就“雕刻”出来,所以画面始终连贯,但搭景本身既耗时又死板,临时改动很麻烦。
而Genie 3更像是一位超快的画师,每秒 24 张画面,边听你描述边即时作画:你说“天开始下雨”,下一帧雨就出现;你转身回到一分钟前经过的小路,树还是那棵树、石头还是那块石头——连贯性自动“长”出来,而不是靠提前搭好的 3D 模型。
3、Promptable World Events(指令触发的世界事件):
除了导航指令外,Genie 3 还支持一种更丰富的文字交互形式,称之为“指令触发的世界事件”。用户或智能体可在运行时追加提示(如“下雨”“加入两只狗”),模型即时重算物理与光照,让世界状态随剧情需要动态演进。
这种能力还拓宽了“如果……会怎样”的反事实场景,让智能体在体验中学习,以应对各种突发状况。
多个Demo展示
1、对世界物理属性的建模:体验水和光等自然现象,以及复杂的环境交互。
提示词:在佛罗里达的一条人行道上行走,一侧是双车道公路,另一侧是大海;飓风即将来袭,狂风呼啸,海浪不断拍打公路。左侧有栏杆将其与海面隔开。道路沿海岸延伸,前方可见一座小桥。海浪接连越过栏杆涌上道路。棕榈树在风中弯曲,雨势滂沱,角色身穿雨衣。真实世界,第一人称视角。
2、模拟自然世界:生成生机勃勃的生态系统,涵盖动物行为到精妙的植物群落。
提示词:高速跟拍现实世界视频,追踪一只水母在深海幽暗的峡谷间疾游。峡谷覆满密集的深海热液贻贝,细小的白蟹在其上爬行。远处模糊的热液喷口从发光的岩石结构中喷出浓厚、翻涌的亮蓝色富矿烟雾。环境极暗,仅有微弱的深海光线,浑浊的海水中漂浮着无数微粒。
提示词:在冰川湖畔奔跑,穿行于森林中岔路纵横的小径,跨越山间潺潺溪流;背景是白雪皑皑的群山和松林,丰富的野生动物让整个旅程妙趣横生。
3、动画与幻想场景建模:释放想象力,创造奇幻场景与富有表现力的动画角色。
提示词:广角镜头下的奇幻森林沐浴在柔和的暮光中,郁郁葱葱,充满魔力。玩家操控一只大型萤火虫,在高耸的树木间飞翔,繁茂的树冠遮天蔽日,斑驳的光影洒落在林地。枝干间点缀着几座迷人的树屋,散发出温暖而诱人的光芒;它们大小、造型各异,有的像童话城堡,有的似温馨小木屋。发光的窗户、微型阳台等细节更添魅力。一条若隐若现的小径在林下蜿蜒,引导观者深入这片魔法森林。整体场景营造出奇迹、宁静与童年梦想的氛围。
提示词:化身折纸风格的蜥蜴
4、探索地点与历史场景:跨越时空,体验各地风貌与往昔年代。
提示词:在克里特岛探索克诺索斯宫殿,重现其最辉煌时期的风貌
提示词:阿尔卑斯山的真实高山景观。地形陡峭,岩壁嶙峋,峡谷狭窄,遍布松散碎石与岩屑。岩石以灰白色为主,峭壁间点缀着绿色植被。峡谷顶部豁然开阔,可眺望茂密的常绿森林与草甸。整体氛围凸显崎岖、原始的自然之美与极端地形。
三大实用场景
虚拟训练场:Genie 3 能在几秒内拼装出仓库、雪道等场景,为机器人或自动驾驶算法提供“无限刷题”的沙盒,比昂贵的真实试验场更灵活。
游戏与内容创作:设计师只需一句话就能生成可游玩的关卡,降低独立游戏开发门槛;影视前期预演、数字孪生亦可受益。
AI 智能体研究:更长、更稳定的交互回合让强化学习与规划算法有机会在同一世界中持续试错、形成长期策略,而不仅仅是“小试牛刀”的短局。
局限性与安全问题
Genie仍然还有一些局限性,包括:
动作空间有限:可提示事件虽丰富,但并非均由智能体亲自执行;直接动作仍受限制。
多智能体交互:在共享环境中准确模拟多个独立智能体仍是挑战。
真实地点的精准再现:目前无法做到完美的地理精度。
文本渲染:清晰文字通常需写入初始描述。
交互时长受限:目前支持连续交互数分钟,尚未达到数小时。
另外,因为安全问题,仅向小范围研究人员开放
Genie 3让“文字一句,世界成型”的愿景更加可玩、可用、可持续。它不仅是世界模型技术的一次性能飞跃,更有望成为机器人和智能体学习的“虚拟地球”,把人类在物理世界中昂贵、缓慢的试验成本迁移到高保真模拟之中。随着可控性、物理精度与安全机制的持续完善,Genie 3 或将把 AI 训练与互动体验同时推向新的维度,为走向 AGI 提供又一块关键拼图。
DeepMind 强调,Genie 3 目前仅向“小范围研究人员和创作者”开放,原因包括对潜在不当内容的过滤仍在测试,以及需要进一步评估大规模交互对系统稳定性的影响。团队透露,后续版本将继续扩展世界复杂度,并探索与 Gemini 系列多模态模型的协同,以实现“看图、对话、行动”一体化智能体。
推荐阅读