蚂蚁发布全球首个视频-动作世界模型,开源即刷新世界纪录
从 2024 年 Sora 惊艳亮相,到今天谷歌正式开放世界模型 Genie 3 的线上体验,“世界模型”这三个字,已经从论文里的概念,变成了普通用户可以亲手走进去、拐个弯、飞一圈的交互世界。
Genie 3 让更多人第一次直观感受到:原来模型不仅能“看见世界”,还能一边感知、一边生成,一个场景会随着你的每一次转向、每一个操作会让内容实时生长。这无疑会进一步加速整个行业对世界模型的关注和投入。
不过,当我们沉浸在 Genie 3 带来的“可玩世界”时,另一条更贴近物理世界的路线,其实已经悄悄往前走了一大步——蚂蚁集团旗下具身智能公司蚂蚁灵波,已经把世界模型真正“装进了机器人身体里”。
今天上午,他们开源了 LingBot-VA ——全球首个基于自回归范式的“视频-动作”世界模型(Video-Action World Model)。它不仅能生成未来的视频画面,更能在想象未来的同时给出一整套动作序列,实现“先思考,后行动”,直接驱动真实机器人在物理世界里完成复杂操作。
1、LingBot-VA 是什么?
简单来说,LingBot-VA 是蚂蚁灵波科技开源的全球首个基于自回归范式的“视频-动作”世界模型(英文名叫做 Video-Action World Model)。它不仅能生成视频,还能在生成未来画面的同时推演并输出动作序列,实现“先思考,后行动”,直接驱动机器人在物理世界中完成复杂操作。
如果这么说还有点抽象,我来举个例子:传统机器人看到苹果,很多时候是“看一眼就伸手”,把视觉理解和动作输出当成两个阶段,从识别到执行。LingBot-VA 更像是人类的手,我们在去拿苹果之前,早就下意识地在脑海里预演了一遍抓取的全过程——手会碰到哪里、苹果可能怎么滚动、下一步该怎么微调动作等等——LingBot-VA 做完这些才会把动作按时间顺序吐出来。
LingBot-VA 在同一个模型里让视频 token 和动作 token 交替生成,形成一个因果上的闭环:机器人终于开始理解“我的动作会如何改变世界”了。
其中真正的突破在于,世界模型开始直接用于驱动机器人在物理世界中完成复杂操作了。
2、因果自回归世界建模
和做具身智能的朋友聊天,他告诉我,这个领域有一个老大难问题,叫“长时漂移”。
什么意思呢?机器人动作越多,误差就越大,到最后完全偏离目标。就像在狭窄走廊里蒙眼走路,前两步还行,走到第十步就开始撞墙。当机器人的第一步有了一点点偏移,最后的结果就会失之毫厘,谬以千里。
造成这个问题的原因主要是:传统方案把视觉理解和动作生成割裂开来,动作只盯着当前帧,不太在意后面的后果。每一步都“差一点点”,差着差着就差到了另一个世界。
LingBot-VA 的做法,是把“后果”变成模型的内置习惯:每输出一个动作,它会同步“想象”这个动作会带来什么画面变化,再根据想象的画面决定下一步。也就是一种“边想边做”的机制——动作不是单向发出去的指令,而是和对未来世界状态的预测绑在一起,形成因果链条。
Framework
这套机制给机器人补上了一个人类与生俱来的能力:三思而后行。人之所以能在复杂环境里完成长序列动作,靠的不是每一步都算得极准,而是随时根据“我刚刚做了什么、环境发生了什么变化”来纠偏。和咱们开车过弯一样,没人能打一把方向盘到位,都是行进之中进行微调,最终完成过弯的目标。
基于这一架构,LingBot‑VA 在 LIBERO 基准上四个任务套件的平均成功率达到 98.5%,其中 LIBERO‑Object 和 LIBERO‑Long 分别达到 99.6% 与 98.5%。在 RoboTwin 2.0 基准的 50 项任务上,其平均成功率为 92.9%(Easy)和 91.6%(Hard),相比此前方法整体提升了约 4–5 个百分点。
在长时序任务上,LingBot‑VA 的优势主要体现在“抗漂移能力”和“相对提升”:例如在 RoboTwin 2.0 的三步长时任务(Horizon=3)上,成功率分别达到 93.2%(Easy)和 93.3%(Hard),相比第二名方法提升 8–9 个百分点;在 LIBERO‑Long 长时套件上,平均成功率达到 98.5%。
在 RoboTwin 和真实任务(做早餐、拧螺丝、折衣服、拆快递、插导管、折裤子)的实验里,LingBot‑VA 在后训练阶段仅用 10、25、50 条演示就做了系统评估:即便只有 10 条演示,表现也已经明显超过 π0.5,而在 50 条演示时各项指标基本收敛,可以稳定部署到真机。
3、这件事为什么这么重要?
把大模型搬上真机,过去最大的障碍之一是延迟。
机器人的控制不像 Chat:慢一秒就是夹爪抓空、杯子打翻、机械臂撞到桌沿。现实世界对延迟没什么耐心,尤其在长时序操作里,每一次迟疑都可能把误差放大成事故。
LingBot-VA 提出的工程化解法是:通过异步推理流水线,把动作预测与电机执行并行化处理;同时引入新的训练策略,使模型在推理时只需要“部分去噪”就能获得高精度动作指令。 意思就是:别让大脑算完了才让肌肉做动作,让它们同时工作;不要每次都把“生成过程”做满,削减最耗时的那部分,保持精度仍然是够用的。
上图是在六个真实机器人操作任务上对 LingBot‑VA 进行的评测,这六个任务覆盖三个类别:长时序任务(做早餐、拧螺丝),高精度任务(插入吸管、拆包发货),以及可变形与关节物体操作任务(叠衣服、叠裤子)。
在这两个关键评价指标上——Success Rate(成功率),Progress Score(任务完成进度得分)——LingBot‑VA 的方法都达到了当前最优水平,证明这套“先思考,后行动”的世界模型范式不只是概念上的突破,而是已经能够在复杂真实场景中稳定工作。
也正因为如此,开源就变得格外重要。对整个行业来说,开源能够让更多做具身智能的团队直接复用这些前沿成果;当一套世界模型范式在公开基准和真机上被验证之后,后续就会有大量团队跟进:做数据的、做仿真的、做硬件的、做控制栈的,都能围绕一个共同的世界模型接口协同演进,而不是各搞各的。
4、蚂蚁在具身智能领域的系列开源和布局
这并不是蚂蚁在具身智能领域的第一个开源,事实上,蚂蚁灵波科技在前几天就开源了具身大模型 LingBot-VLA 和 空间感知模型 LingBot-Depth 和世界模型 LingBot-World,其中 LingBot-VLA 除了提供模型权重,还同步开放了包含数据处理、高效微调及自动化评估在内的全套代码库。
LingBot‑VLA 是一个面向真实机器人操作场景的具身智能基座模型,是专门为了真机抓取、放置、叠毛巾、擦桌子这类具体动作设计的,解决的是泛化问题,让同一个“大脑”可以控制不同机器人、执行不同任务。
LingBot‑Depth 的主要作用,是给机器人提供高质量、可泛化的场景深度感知,让“看得见”变成“看得清、看得准、懂空间”。
LingBot-World 是一个专为交互式世界模型设计的开源框架, 致力于提供高保真、可控制且逻辑一致的模拟环境。该模型由一个可扩展数据引擎(Scalable Data Engine)驱动,通过从大规模游戏环境中学习物理规律与因果关系,实现了与生成世界的实时交互。
LingBot-VA 是第四个开源模型。如果把 LingBot-VA 看做“会思考的手”,LingBot‑VLA 就是给真实机器人用的“通用大脑”,LingBot-Depth 则是一双“看得清的眼”,LingBot-World 则是个交互式的世界。
LingBot‑VLA 和 LingBot‑Depth 结合,能在透明、反光等复杂场景中补全缺失深度,让机器人能够判断杯子和桌面的实际距离,精确规划动作。LingBot‑VLA 在 GM‑100、RoboTwin 2.0 等基准上真机成功率超过了此前被视为标杆的 Pi0.5。
把 LingBot-VLA、LingBot-Depth 和 LingBot-VA 放在一起看,蚂蚁灵波科技的布局就变得像一条完整链路:先解决机器人通用大脑的问题,再解决“看得清”的空间感知,然后是“先思考,后行动”的视频-动作因果闭环。
5、从“想象世界”到“改变世界”
虽然现在最火热的项目和产品都和 LLM 强相关,但我一直以为,世界模型的终极形态更有想象力。
LLM 改变的是多模态的世界,处理的对象是文本、图片、音频、视频,它让信息的生产与组织能力大大增强。世界模型改变的是物理世界:不只是回答问题,而是开始移动物体、重排空间、执行任务、承担后果。
和很多四五十岁的朋友聊天,说怎么养老呢,孩子是指望不上,养老院不想去,那就蹲一个养老机器人吧。你别说,养老机器人还真得靠世界模型的发展。
LingBot-VA 等系列模型的方向已经很清晰了:让机器人学会“三思而后行”。 对人类来说,这是一句老话,但放在具身智能里,它是一条务实的工程路线:把“想象”变成控制的一部分,把“世界会怎样”写进每一步动作的生成里。
从某一天起,世界模型不再只是屏幕里的梦。想象接入现实,世界就会被它改写。