GEN-0:机器人领域的"GPT时刻"——首个验证缩放法则的具身智能模型
2025年11月,Generalist AI团队发布了GEN-0模型,这可能是机器人领域迄今最重要的突破之一。如果说GPT系列证明了"语言智能可以通过数据和算力规模化",那么GEN-0则首次证明了物理智能同样遵循可预测的缩放法则。
三个改变游戏规则的发现:
- 物理智能存在相变阈值:7B参数是分水岭,小模型"学不动",大模型持续进化
- 缩放法则在真实世界成立:更多数据→更强能力,关系可用数学公式预测
- 数据不再是瓶颈:27万小时真实操作数据,每周增长1万小时且加速中
这意味着什么?机器人智能的发展路径从此变得可预测、可规划、可投资——就像五年前的大语言模型一样。
一、为什么现在才出现机器人的"缩放法则"?
过去十年,机器人学习主要依赖两种方法:一是从视觉-语言模型迁移能力,如Google的RT-2;二是为每个任务单独训练模型。但这两种方法都缺少关键一环:缩放法则。
在大语言模型领域,研究者发现模型性能与参数量、数据量、算力之间存在可预测的幂律关系,这让AI公司可以提前规划投入、预测模型能力边界。
机器人领域一直未能证明这种关系存在,原因包括:真实世界交互数据收集成本高、评估标准难统一、此前模型参数量不够大。GEN-0首次填补了这个空白。
Moravec悖论:为什么物理智能这么难?
1988年,机器人学家Hans Moravec提出:
“让计算机在智力测验或下棋中达到成人水平相对容易,但要让它们拥有一岁小孩的感知和行动能力却极其困难。”
这背后是进化历史的差异:人类抽象推理能力只有几万年历史,而感知运动能力经过数亿年进化。
GEN-0为这一悖论提供了定量证据:语言模型在约10M参数规模出现学习饱和,而机器人模型要到1B参数才开始饱和——100倍参数差距。
二、七十亿参数的"魔法阈值"
Generalist AI团队训练了四个不同规模的模型:1B、6B、7B和10B+参数。所有模型使用相同训练数据和流程,唯一变量是模型大小。在完全保留的长期下游任务上测试零样本next-action预测误差。
实验结果呈现明显分化:
1B模型:学习能力崩溃
训练到一定程度后,1B模型的误差曲线开始上扬,出现"模型僵化"(Ossification)现象——模型权重无法继续吸收新信息,在数据过载下学习能力崩溃。
6B模型:开始受益
展现持续下降的误差曲线,能从预训练中获益,展现跨任务知识迁移能力。
7B+模型:质的飞跃
误差下降速度显著加快,能够内化大规模预训练数据,只需数千步后训练即可迁移到新任务。10B+模型继续这一趋势,对新任务的适应性越来越快。
机器人领域首次观察到"模型僵化"
在大语言模型文献中,模型僵化已有研究,发生在O(10^7)参数规模。而机器人领域的僵化发生在O(10^9)参数规模——100倍参数差距再次印证了Moravec悖论。
论文指出,此前未发现这一现象是因为需要同时满足两个条件:高数据量训练regime和足够大的模型规模。GEN-0同时满足了这两个条件,才揭示了这一现象。
这个7B阈值揭示了物理智能存在"激活阈值":低于阈值时模型容量不足以压缩多样化物理交互数据,高于阈值后涌现持续学习能力。
三、可预测的力量:机器人也有缩放法则了
缩放法则的威力在于:模型性能与训练资源之间存在稳定、可预测的数学关系。
OpenAI在2020年证明,语言模型的性能可以用幂律公式预测。这让AI公司能提前规划需要多少GPU和数据,在增加数据还是增加模型大小之间做出最优选择,甚至外推下一代模型的能力边界。
但机器人领域此前没有这样的公式。GEN-0改变了这一点。
实验怎么做的?
团队使用不同规模的预训练数据子集训练了多个模型检查点,然后在16个任务集上同时进行监督微调。这些任务覆盖三个维度:
- 灵巧性:搭建乐高、精细装配
- 行业应用:快餐包装、服装处理、汽车零件
- 泛化能力:"处理任意物体"类任务
结果非常清晰:所有16个任务都遵循相同规律——更多预训练数据带来更好的后训练性能。
关键观察:这不是某些任务受益,而是所有任务都受益。而且收益符合幂律衰减,不是线性关系。即使预训练没见过服装任务,服装处理性能也提升了。
公式来了:预测未来性能
GEN-0团队拟合出了预测公式:
L(D) = (Dc / D)^αD
其中:
L(D) 是给定预训练数据量 D 时下游任务的验证误差
Dc 是特征数据规模常数
αD 是缩放指数
有了这个公式,可以回答关键问题:
达到特定next-action预测误差需要多少预训练数据?
给定固定微调预算,增加预训练数据可以换取多少后训练数据?
论文指出,结合模型规模缩放法则,这些结果可以预测任何下游后训练任务的最优计算和数据分配。
与语言模型的关键差异
语言模型的数据可以从互联网爬取,边际成本接近零。而机器人模型需要真实物理交互,每增加一小时数据都需要真实的硬件、空间和时间成本。
这意味着机器人领域的数据壁垒更高,但一旦建立起数据飞轮,先发优势也更难被打破。
四、和谐推理:让机器人边思考边行动
大语言模型可以"深思熟虑"。OpenAI的o1模型在回答前会进行长时间"思考",用户可以等待,因为数字世界可以暂停。
但物理世界不行。当机器人"思考"时,物体仍在下落;当机器人"规划"时,环境在持续变化。延迟100毫秒,抓取就可能失败。这就是实时性约束——机器人AI面临的独特挑战。
传统解决方案有两种:一是System 1 - System 2架构,设计快速反射系统和慢速思考系统,但需要显式设计切换逻辑;二是推理时引导,在生成动作前运行多次前向传播,但会增加延迟和计算成本。
GEN-0提出了全新范式:和谐推理(Harmonic Reasoning)。
异步双流:在连续时间中思考与行动
核心思想是模型同时维护两个异步、连续时间流:
感知流:持续接收传感器数据
行动流:持续输出控制指令
两个流在连续时间域中"和谐"交织,无需显式同步点。这使模型可以扩展到非常大规模,而不依赖System1-System2架构或推理时引导。
组装相机套件:长期任务的无缝执行
论文展示了一个复杂的长期任务:从自上而下视角组装相机套件。
任务包括:将清洁布放入盒中、折叠纸板托盘、从塑料袋中取出相机并去袋、将相机放入盒中、关闭盒子并插入微小卡扣、丢弃塑料袋。
关键点:模型不维护任何显式的子任务概念,整个过程在单一和谐推理流中完成。没有"IF 完成子任务1 THEN 开始子任务2"的逻辑,所有决策都是从原始感知到原始行动的端到端映射。
论文强调,和谐推理涉及根本性的新训练方法,但未公开具体技术实现细节。
五、数据帝国:27万小时的物理世界知识库
史无前例的规模
GEN-0在内部机器人数据集上预训练,该数据集包含超过270,000小时真实世界多样化操作数据,以每周10,000小时的速度增长且仍在加速。
这一规模比现有最大的机器人数据集(截至2025年11月)高出数个数量级。论文展示的对比图显示,GEN-0的数据量远超Open X-Embodiment、RT-X等现有数据集。
映射操作的宇宙
团队正在构建有史以来最大、最多样化的真实世界操作数据集,涵盖人类能想到的每一个操作任务——论文提到"从削土豆到螺栓穿线",跨越家庭、面包店、洗衣店、仓库、工厂等多种环境。
团队构建了内部搜索工具来探索这个数据宇宙,使用t-SNE将语言标签嵌入映射到2D空间。相似任务在地图上聚集成簇,给定文本描述后系统定位最近邻区域并随机采样相关视频。
论文特别强调:展示的可视化只包含不到1%的预训练数据集。
互联网规模的基础设施
支撑这一规模需要强大的工程基础设施。论文提到:
定制硬件
定制数据加载器
铺设新的专用互联网线路支持全球数据采集站点的实时上传
多云合约
O(10,000) CPU核心持续进行多模态数据处理压缩数十Petabytes数据
使用前沿视频基础模型背后的数据加载技术
每训练一天能吸收6.85年真实世界操作经验
预训练的科学:数据配方学
论文强调,不同的预训练数据混合会产生具有不同特性的GEN-0模型。团队对比了8种预训练数据集,这些数据来自不同数据代工厂合作伙伴,按收集模式分类:
- Class 1:特定任务数据
- Class 2:中间类型
- Class 3:"do-anything"自由操作数据
评价指标除了预测均方误差(MSE),还使用了反向KL散度(Reverse KL):
反向KL是mode-seeking(集中在主要模式),而前向KL是mean-seeking(覆盖所有模式)。对机器人而言,低反向KL意味着模型对自己的预测很确信。
实验发现不同数据配方产生不同特性的模型:
- 低MSE + 低KL:准确且确信,适合监督微调(SFT)
- 高MSE + 低KL:分布多模态,适合强化学习(RL)
论文强调:“数据质量和多样性比纯粹数量更重要,精心构建的数据混合能产生不同特性的模型。”
在规模上拥有多种数据收集策略,使团队可以持续A/B测试哪些数据最能改善预训练,并将反馈提供给合作伙伴以迭代优化数据收集方法。
六、实战能力:GEN-0到底能做什么?
跨具身验证
论文指出,GEN-0架构在设计上就支持不同的机器人。团队已经在6DoF、7DoF和16+DoF半人形机器人上测试了模型。
这意味着同一个基础模型可以适配不同的机器人平台,而无需为每个平台从头训练。
任务覆盖
论文展示的16个任务集涵盖了三个评估维度:
灵巧性(Dexterity) - 包括Build Lego(搭建乐高)等需要精细操作的任务
真实应用(Real-world Applications) - 包括Fast Food Packing(快餐包装)、Clothes Handling(服装处理)等行业工作流。服装处理任务在真实工作场所进行,涉及分类、整理、扣纽扣和挂衣服
泛化能力(Generalization) - 包括"_ anything tasks"(处理任意物体类任务),用于评估模型在未见过场景中的表现
所有这些任务都展现出随预训练数据增加而性能提升的趋势。
我们正见证历史的转折点
2012年,AlexNet证明了深度学习在计算机视觉中的威力。2017年,Transformer重新定义了自然语言处理。2020年,GPT-3展示了大规模预训练的震撼。2025年,GEN-0可能为机器人AI写下同样重要的一笔。
这篇文章不是终点,而是起点。
它提出的问题比给出的答案更多:物理智能的极限在哪里?数据飞轮会走向何方?通用具身智能何时到来?
但有一点是确定的:机器人AI的规模化时代已经开启。
接下来的5-10年,我们将见证机器人从工厂走向家庭,从特定任务到通用能力,从昂贵的奢侈品到普及的服务。
这不再是科幻,而是正在发生的现实。而这一切,或许正从GEN-0开始。
原文地址:https://generalistai.com/blog/nov-04-2025-GEN-0