π0引用的中国团队,又出手了:世界仿真器新作发布
允中 发自 凹非寺
量子位 | 公众号 QbitAI
机器人撬开啤酒瓶盖,白色泡沫顺着瓶口涌出来。
△ 图源:π0论文References
从早期的VLA大模型、人类示教数据,逐步延伸至全身机器人学习,这些前沿探索最终沉淀为Current Robotics的技术基石。 而对于刚刚亮相的 这套 交互式世界仿真器,团队的核心目标很明确:机器人的身体和观察方式可以千差万别,但在走进真实世界前,它们演练的必须是 同一个世界 。
评测机器人,首先需要一个不会替策略纠错的世界
机器人世界模型有一个很自然的起点:视频生成模型。 经过大规模预训练之后,模型已经记住了不少视觉和运动规律:物体被遮挡后不会凭空消失,形状不会突然改变,运动在时间上也通常是连续的。 一次常见的抓取会怎么发生,模型其实已经“看过”很多遍,这对视频生成当然是好事。 但机器人训练数据里大量的成功范例,让模型见惯了“伸手—抓住—拿起”这样的轨迹。当一个还没训练好的策略把手伸偏,视频先验有时反而会把后面的结果继续往“成功”上补。 机械臂实际没有抓稳,生成画面里的物体却还是跟着手走了。真实执行已经失败,世界模型给出的未来却仍然顺利完成了任务。 放到机器人评测里,这样的“纠错”会直接让结果失真。 Current Robotics此前在 dWorldEval 中研究的,正是世界模型的 动作可控性(action controllability) :动作发生变化,后面的世界也必须跟着变。 机器人往左偏了一点,物体不能还沿着原来的轨迹走;动作已经失败,模型也不能替它把后面的结果补回成功。 对于CurrentWorld来说,这是一条最基本的要求: 机器人怎么做,世界就怎么变化;即使做错了,模型也不能替它把结果纠正回来。CurrentWorld-0:评测机器人,为什么需要跨本体、多视角和力-触觉?
假设现在要评测一个最简单的动作:让机器人把桌上的杯子往前推一点。 如果执行者是一台固定双臂机器人,动作可能只涉及机械臂;换成移动升降双臂,底盘和升降机构也可能参与进来;再换成人形机器人,整个动作又会落到另一套全身控制上。 同样一句“把杯子往前推”,到了不同机器人身上,真正输入给模型的动作已经完全不同。 CurrentWorld-0因此没有先规定一种所有机器人都必须使用的动作格式,而是保留不同本体自己的 Action Subspace 。 模型需要做的,是把这些不同形式的动作继续往后推演:杯子受到了什么影响,位置发生了多少变化,后面的场景又该怎么接下去。 这也是跨本体建模真正困难的地方。 机器人可以换,动作接口可以换,但杯子不会因为执行者换了,就突然变得更轻、更重,或者开始遵循另一套运动规律。- 机器人按照自己的方式发出动作,物体随之变化;
- 多个摄像头从不同位置记录这个结果;
- 真正发生接触以后,力和触觉再补上画面里难以直接看到的部分。