梁博谈一谈:卡在数据“石器时代”,具身真的智能吗?
去年拜访一家做人形机器人的创业公司时,他们的算法负责人给我算了一笔账:训练一个能稳定抓取不规则物体的策略模型,需要大约10万条真实操作轨迹。他们的遥操作采集员拿着手柄,一天工作8小时,大概能采300条有效数据。简单除法,一个人要干一年多。
这还没算数据清洗、标注、对齐的成本。
那一刻我意识到,具身智能领域正在上演一场荒诞的对比——我们用着最前沿的 AI 架构,却在用最原始的方式攒数据。大模型一顿炫万亿 Token,机器人还在按 “条” 抠数据。
这不是某个公司的问题,是整个行业的结构性困境。
看似easy,
为何数据还在“石器时代”?
具身智能是有物理身体的 AI,就是能走路、抓取、交互的机器人。它的数据和AI训练常用的文本、图片、视频语料完全不是一回事。要理解这个困境,得先明白具身智能的数据到底特殊在哪。
物理世界的数据,根本爬不到
训练大语言模型的数据可以通过爬取信息获得,但我们却很难直接爬取物理世界。每一个动作数据都需要真实的机械臂、真实的传感器、真实的交互过程。这意味着数据采集的边际成本几乎不变——你采第1条和第10万条数据,花的时间差不多。
更坑的是数据分布碎片化:同样是“抓取”这个动作,抓杯子、抓螺丝、抓布料,背后的物理规律完全不同;工业场景、家庭场景、医疗场景的数据几乎无法通用。想要像NLP那样,用通用语料预训练一个“基础模型”,然后微调?根本行不通!
多模态对齐,这是个行业噩梦
机器人需要同时处理视觉(看到了什么)、力觉(接触力大小)、触觉(纹理、温度)、本体感知(关节角度、速度)。这些数据的时间戳要对齐,坐标系要统一,噪声特性要匹配。
我见过一个业内真实惨案:某团队用视觉和力觉数据联合训练模型,训练了半个月,效果都很差。最后排查出来的原因是两块传感器的时钟差了20毫秒——对人来说微不可察,对机器人的高频控制来说就是灾难性 BUG。
长尾问题,至今无解
机器人最终要进入真实世界,而真实世界全是意外。
工厂里99%的时间在处理常规零件,但1%的异常工况可能导致产线停摆。问题是,那1%的数据你提前根本采不到,因为你没法预知所有可能的故障模式。
一位做工业机器人的朋友告诉我,他们最头疼的不是训练模型,而是“我的训练集里根本没有这个case”。
行业现状:
“土法炼钢” 攒数据
面对这些困境,行业目前的主流解法其实都很“土”。
遥操作采集:用人的时间换数据
这是目前最靠谱的方式。就是让人戴着VR头盔或者拿着手柄,远程控制机器人做动作,同时记录数据。特斯拉的Optimus、Figure AI都在用这套方案。
问题在于,这本质上是人力堆量。一位熟练的采集员时薪几百块,一天产出的数据量却有限。
更隐蔽的成本是数据质量的方差。不同采集员的操作习惯不同,同一个人上午和下午的状态也不同。这些数据混在一起训练,模型学到的其实是“平均意义上的人”,而不是最优策略。
仿真数据:看上去很美
在NVIDIA Isaac Sim、Mujoco里搭建虚拟环境,让机器人自己跑,数据要多少有多少。
但Sim-to-Real Gap(仿真到现实的鸿沟)至今填不平。物理引擎的摩擦模型、接触动力学和现实总有偏差。一个在仿真里能完美抓取的策略,放到真实机械臂上可能因为0.1毫米的位姿误差而失败。
现在的折中方案是域随机化,在仿真里故意加入各种噪声(摩擦系数随机、物体重量随机、光照随机),希望模型学到更鲁棒的策略。说白了,这就是凑合用的权宜之计,而不是根本解法。
数据共享:看着挺热闹
谷歌牵头做的Open X-Embodiment数据集,汇集了60多个机器人数据集、100多万条轨迹,是领域内的ImageNet时刻。
但现实是,机器人数据比图像数据敏感得多。机械臂的运动学参数、控制频率、传感器型号都是商业机密。不同厂家的数据格式千差万别,对齐成本极高。目前的数据集更多是学术意义,离工业界的实际需求还有距离。
范式转移:
从“手工采数”到“生成世界”
困境倒逼变革。我认为接下来几年,具身智能的数据服务会经历几个层面的范式转移。
世界模型,将改变数据生产的逻辑
Yann LeCun这几年强推的世界模型,核心逻辑是:智能体应该像人类一样,对世界有内在的“心理模拟”能力。不是被动地记录数据,而是让 AI 在大脑里模拟物理世界,预测“如果我做这个动作,世界会怎样变化”。
如果这条路走通,数据采集将从“探索”变成“验证”。机器人先在内部世界模型里尝试千百万次虚拟动作,只把最有价值的动作拿到真实世界执行。数据效率直接提升几个数量级,不用再傻呵呵一条条采。
DeepMind的Genie、Meta的JEPA都是这个方向。目前还在早期,但逻辑上是通的——人类学开车也不是靠撞一万次车,而是靠大脑里的物理直觉。
合成数据,将进入“物理正确”时代
现在的仿真数据之所以有gap,是因为物理引擎是简化的。下一代方案可能是神经物理引擎——用神经网络学习真实的物理规律,而不是手写公式。
NVIDIA的NeRF、3D Gaussian Splatting技术已经能重建高保真的静态场景。下一步是动态物理:从真实世界的视频里学习“物体碰撞后怎么动”“布料折叠的规律”,然后用于生成合成数据。
这种数据不是“看起来像真的”,而是“物理上等价于真实数据”。如果这条路走通,仿真数据的占比可能从现在的10-20%提升到80%以上。
从LLM偷师,自监督学习的想象力
LLM能吞下万亿级token,靠的不是人工标注海量问答对,而是“掩码语言模型”——把一句话里的某个词遮住,让模型自己去猜。这种自监督信号藏在每一条原始文本里,把数据效率提升了几个数量级。
具身智能完全可以借鉴这个思路。给机器人一段完整的操作轨迹(视觉+关节+力觉),随机遮住中间几帧,让模型去补全。
一个“抓杯子”的轨迹,可以生成成百上千个自监督任务,通过举一反三的练习,泛化提升机器人对物理世界的理解能力,应对新的场景。模型在这个过程中学到的不是具体的抓取策略,而是物理世界的时序因果关系——如果手在这里,杯子下一帧会在哪。
需要强调的是,这目前还只是一个技术畅想,不是已经验证的落地路径。机器人数据的连续、高维、噪声大等特性,决定了自监督的效果远没有LLM中那么神奇。
但这个方向至少说明一件事:在等待世界模型和物理引擎成熟的同时,我们可能已经在现有数据里埋藏着巨大的信息量没有被榨干。
这条路的好处是:不需要额外采集任何真实数据,只需要改变训练目标。
数据服务,从“卖数据集”到“卖能力”
现在的数据服务商大多是项目制——客户提需求,服务商派人去采数据、做标注,按数据量收费。这种模式天花板很低,边际成本降不下来。
未来的形态可能是云化数据基础设施。就像云厂商卖算力一样,出现“数据即服务”的云化DaaS平台:
1、客户上传一个需求(如,“我需要10万条汽车装配场景的数据”)
2、平台自动调度全球的遥操作中心、仿真集群、数据清洗流水线
3、直接交付训练好的模型或者对齐好的数据集
这要求平台掌握跨本体的数据对齐能力,也就是不同厂家的机械臂、不同型号的传感器,数据能统一表示、统一训练。这是技术壁垒,也是商业模式的护城河。
未来可期:
3-10 年行业彻底变天
回到开头那个问题:我们什么时候能摆脱“石器时代”的数据采集?
我的判断是,3年内会有阶段性突破,10年内会完全改变。
短期内(1-3年),遥操作+仿真混合仍然是主流,但工具链会成熟。更好的VR设备、更自动化的标注工具、更高效的仿真引擎,数据采集的成本可能下降一个数量级。
中期(3-5年),世界模型和神经物理引擎会进入实用化。部分场景(如结构化工业环境)可能实现场景全仿真的训练流程。
长期(5-10年),机器人可能像现在的LLM一样,有通用的预训练阶段。它们从海量异构数据中学到物理世界的通用规律,然后在具体场景少量微调即可。
这个过程中,数据服务商的角色会从“劳动力密集型”转向“技术密集型”。现在比拼的是谁能雇到更多采集员,未来比拼的是谁的仿真引擎更准、谁的世界模型更真。
对于创业者和投资者来说,具身智能的终局一定是智能本身。但在到达终局之前,卖铲子的人,那些解决数据瓶颈的基础设施公司,可能才是最稳妥的押注。
毕竟,无论哪家机器人公司赢,它们都需要数据。