Z Potentials

深度|行业还在争论数据路线,第一个具身数据独角兽已经跑出

Image
Image

导语

刚刚过去的2025年,具身智能经历了一次前所未有的罕见“情绪高点”。从资本市场到大众舆论,机器人几乎成为科技行业最具想象力的叙事之:春晚舞台上的形形色色的机器人表演,超市商场里整活卖货的机器人熟练工,资本密集关注下热钱的加速涌入,高潮迭起,风起云涌。

进入2026年,行业热度丝毫未减。然而,在众声喧哗的表象之下,一个更根本、也更无法回避的问题,正悄然浮出水面:

机器人究竟该用什么数据进行训练?

这不是技术路径上一个可有可无的选择,而是决定着具身智能能走向规模化的核心变量。它横亘在行业面前,成为当前具身智能领域中分歧最深、争议也最为集中的关键地带。

更重要的是,这个问题并不只是中国创业者在争论。随着越来越多硅谷具身团队进入大规模训练阶段,“数据从哪里来、什么数据真正有效、谁能稳定交付高质量数据”正在成为核心圈层里被反复讨论的问题。

一、分歧与分裂:具身数据的“非共识”争锋

数据路线是过去两年具身智能最大的争论部分。目前行业内主要存在三条训练数据路径:仿真合成数据、真实世界机器人数据、人类行为示范数据。

仿真派强调规模优势,认为机器人训练最终一定要走向大规模仿真合成数据。真实世界派则认为,机器人最终要解决真实世界的问题,训练就必须建立在真实世界原生数据之上。与此同时,人类行为示范数据也快速崛起,一些团队认为,机器人真正缺乏的不是环境数据,而是人类操作策略,因此第一人称视频、远程操控、UMI等数据正在成为新的重点。

这三条数据路线几乎同时并存,彼此互搏,不同创业团队给出的答案几乎完全相反。前段时间,银河通用创始人王鹤和星海图创始人高继扬就这个话题进行了一次激烈交锋。

银河通用创始人王鹤认为真实数据只是“补丁”,合成数据才是基本盘,他提出一种极端比例:99%合成数据+1%真实数据,认为这是机器人规模化训练的终局结构。星海图创始人高继扬则坚持另一种观点:真实世界原生数据才是具身智能的底座,过度依赖仿真,是行业最大的捷径陷阱。

表面上看,这只是数据路线之争。但如果从深层思考,这场争论其实暴露出一个更深层的问题:具身智能的数据体系正在快速碎片化。

这种碎片化体现在多个层面。首先是数据来源的不统一,有些公司主要依赖仿真环境生成数据,有些则完全来自真实机器人采集,还有一些则以人类操控数据为核心。其次是训练方法的分裂,不同数据结构,对应着完全不同的训练范式,各家公司几乎各自为战。更关键的是评测体系的缺失,目前行业还没有一个统一标准,可以客观衡量不同模型在真实任务中的能力。这使得不同团队之间的技术成果很难直接比较。

换句话说,整个行业正处于一种高度分散的状态:数据来源不统一,训练方式不统一,评测标准也不统一。但从更高层的视角看,这种分化意味着行业真正缺失的,其实并不是某一种特定的数据,而是一套能够将不同来源、不同形态的数据统一起来的数据系统。

行业仍在激烈争论数据路线孰优孰劣时,结果已经先一步出现了,投资机构已投出了自己的一票。

Image

近日,具身数据与仿真基础设施公司光轮智能宣布完成A++与A+++轮融资,总额达10亿元人民币。随着本轮融资落地,光轮正式进入独角兽行列,成为全球首家具身数据领域的独角兽公司。

在机器人本体公司和具身模型团队频繁成为聚光灯焦点的当下,一家以“数据”为核心能力的公司能够拿到如此规模的融资,这件事本身就已经说明了一个趋势:市场正在重新理解具身智能数据规模化的底层价值。这也是光轮能够在短时间内跻身“具身数据独角兽”的关键原因:当行业仍在争论数据路线时,它试图解决的,是更底层的数据生产与系统化问题。

更关键的是,光轮并不是凭借某一个单点能力获得认可,公司已在多个关键维度上已经率先跑出并领先:

  • 全球具身数据规模最大的企业;

  • 目前全球唯一同时覆盖仿真合成数据、人类行为数据与仿真评测体系的公司;

  • 在仿真合成数据、仿真评测、人类行为数据三个维度,光轮均已实现全球交付冠军;

  • 全球领先的具身团队中,约80%的仿真资产与合成数据来自光轮。

据ZP了解,在硅谷具身智能圈子里,光轮已经是一个高度熟悉的名字。多位从业者提到,随着具身训练需求快速上升,光轮几乎成为部分顶级团队的默认数据合作对象。

一个现实情况是当前硅谷数据行业价格战已是常态,市场上甚至频频出现多家团队争抢同一批交付资源的现象,被动接单者比比皆是。相较之下,光轮的站位与策略显得截然不同——其定价从未走低价路线,甚至常年处于行业高位,如今更已从被动接单转向主动筛选合作伙伴。而这恰恰构成了它的品牌底色和价值锚点:顶级客户真正在意的,从来不是“最便宜的数据”,而是“什么数据真正有效、什么质量底线不能被妥协”。

从商业合作延伸出去,光轮的角色还在进一步外溢,它正逐渐成为具身智能研究社区中的一个连接节点,期间,光轮团队长期与不同研究者、创业团队保持高频交流,甚至在一些具体技术问题上主动牵线,帮助不同团队建立联系。随着合作版图持续扩展,一个围绕具身数据与仿真的研究者网络,也在悄然成形。某种意义上,光轮不仅在输出数据能力,也在参与塑造一个更加紧密的具身智能社区。

二、为什么是光轮:不押注路线,而是构建底层系统

为什么光轮能成为全球首个具身数据独角兽公司?

答案或许在于它从一开始就没有把自己定义成“某一路线的数据公司”,而是定义成一个系统的构建者。事实上,光轮从一开始就没有把赌注压在某一种数据来源上。公司内部的判断是:任何单一数据来源,都不足以支撑具身智能的长期发展。

光轮的判断来自自身的经验以及对长期主义的前瞻性判断:如果只做仿真,会遇到真实性问题。如果只做真实数据,又无法规模化。如果只做人类视频数据,也缺乏环境与评测体系。因此光轮选择了一条更复杂也更难的路径:通过构建仿真技术内核,合成数据体系、第一人称人类视频数据网络、仿真评测系统,打造闭环,构建数据与仿真基础设施平台。

在硅谷数据生态中,讲路线、追热点的团队不在少数,但真正能长期服务国际顶级客户,并与之一道定义需求、划定质量线、构建评测标准的公司,实则寥寥无几。某种意义上,这正是光轮最难被复制的壁垒:它不止于交付数据,更深度理解顶级客户究竟需要什么样的数据。

据ZP了解,在一些项目中,光轮与客户的合作方式已超越传统数据公司,更接近“共同研发”。顶级具身团队往往会直接参与数据结构设计、任务定义乃至评测指标的讨论,而这些输入又会反哺到光轮自身的数据系统构建之中。正是这种双向互动,让光轮不再仅仅是数据的提供者,而是在与客户共同回答一个更根本的问题:什么样的数据,才真正有用?

因此,光轮选择的不是“路线”,而是“系统”。这套系统是:World–Behavior–Eval。

Image

光轮最早的切入点,其实并不是数据,而是仿真平台本身。团队在创业初期的目标,是构建一个能够规模化生成具身任务环境的仿真系统。因为在具身智能训练中,一个完整的环境:空间结构、物体属性、物理交互,这些都决定了模型训练的上限。

为了实现这一目标,光轮从底层开始自研仿真内核,并围绕三个关键能力展开:

首先是高精度物理测量能力。团队建立了一套自动化的“物理测量工厂”,这些真实世界的数据随后被数字化,成为仿真世界的基础。其次是非刚体仿真能力。现实世界中,大量物体并不是简单的刚体,而是复杂结构。光轮为此全栈自研了刚体与非刚体的仿真solver,并通过真实世界实验不断进行校准,使仿真行为逐渐逼近现实。第三是大规模具身资产生成能力。在仿真内核之上,系统可以批量生成具身任务环境,从家庭场景到工业操作,从抓取任务到复杂交互,为机器人训练与评测提供可扩展的场景库。

World层搭建好之后,团队很快意识到一个关键问题:仿真的规模化,本质上依赖真实世界。如果缺少真实世界的数据反馈,仿真规模越大,误差反而会被不断放大。也正是在这个阶段,光轮意识到,仅仅依靠仿真体系并不足以解决问题。

为了解决仿真校准问题,光轮开始建立一条Real2Sim的数据链路,构建Behavior层能力。团队同时布局了两类在行业中最具规模化潜力的数据来源。

第一类,是第一人称人类视频数据。人类操作行为本身就是一种天然的数据来源。团队很早就意识到,如果能够规模化获取第一视角的人类操作视频,这些数据既可以直接用于模型训练,也能够为仿真系统提供真实世界的行为先验。一条可扩展的Real-to-Sim Pipeline形成。

更重要的是,这类数据不仅是训练资源,也逐渐成为光轮的商业化产品之一。原本用于校准仿真的真实行为数据,在规模化之后,不仅成为训练资源,也逐渐演化为平台能力本身的一部分。

第二类,则是仿真合成数据。依托已经建立的仿真内核,光轮可以在虚拟环境中生成大量训练数据,覆盖真实采集难以触及的长尾场景,且这类数据的边际成本极低,能够快速扩展训练规模。

关键在于,这两条数据链路并不是彼此替代,而是相互校准、相互增强:人类视频数据让仿真更加真实,而仿真生成的数据则弥补了真实采集在规模与长尾场景上的不足。

当真实数据与仿真数据逐渐建立起来之后,一个新的问题随之出现:如何保证数据闭环高质量的运转?

在大模型领域,Benchmark与评测体系已经成为行业共识。但在具身智能中,类似的标准仍然非常稀缺。不同团队的数据结构、任务设置和环境条件各不相同,使得数据质量很难被系统化衡量。光轮给出的解决方案,是再次利用仿真。

通过已经被真实数据校准过的仿真环境,团队可以反过来对真实数据进行系统化评测。于是,一个闭环开始形成。从Real to Sim通过Eval再回到Real。通过仿真评测系统,光轮能够观察到客户模型在不同任务中的能力边界,从而预测他们下一阶段所需要的数据类型。光轮随后将这一能力产品化,推出了RoboFinals仿真评测体系。

这一闭环的价值,正在硅谷顶级研究团队的语境中得到印证——评测从来不只是“验证结果”,而是定义能力边界、定义行业标准的一部分。谁能提供被广泛接受的评测框架,谁就更可能掌握下一阶段的话语权。

一个有趣的小插曲是:之前有一家硅谷顶级具身大脑公司长期对仿真持谨慎态度,其创始人甚至一度认为仿真难以真正反映模型的能力边界。但即便如此,这家公司最终仍主动选择与光轮合作,希望借助RoboFinals持续评估其具身大脑在不同任务中的表现状态。某种意义上,这恰恰印证了一个趋势:当训练数据与真实世界反馈仍然高度碎片化时,行业对一套可信评测体系的需求,往往比对某条数据路线的争论更为迫切。RoboFinals的价值也因此不再只是“测模型”,而是在顶级团队的研发流程中,逐渐承担起“能力诊断系统”的角色。

从这些层面看,光轮相当于构建了一个自驱动且可以持续运转的数据闭环:

  • World构建物理准确的仿真底座;

  • Behavior打通真实世界与合成环境之间的双向数据来源;

  • Eval评测体系衡量模型能力。

仿真校准数据,数据驱动评测,而评测结果又反过来决定下一轮数据采集与生成的方向,三者彼此咬合,循环运转,在这样的循环之中,数据不再只是一次性的资源,而成为一个能够不断自我强化的系统。

这也正是光轮与传统数据公司的本质区别:它交付的不是某一类数据,而是在构建一层全新的具身数据与仿真基础设施。

Image

三、数据与仿真飞轮,具身智能的新数据与仿真基础设施

目前,光轮已累计交付数百万小时级别的具身数据,其中超100万小时为高质量的人类第一人称视频数据。在全球具身智能最前沿的客户视角里,光轮已经不只是一个数据交付方,而逐渐成为许多团队训练流程中的“默认基础设施”。对于正在进行大规模训练的团队来说,与光轮合作往往不是一个单独的采购决策,而更像是训练系统中的一个标准组件。

随着越来越多团队进入大规模训练阶段,数据和仿真环境的需求正在快速释放。如果说具身智能正在步入属于自己的数据Scaling Law时代,那么围绕数据和仿真构建起的基础设施层,也正成为新一轮产业竞争的核心。

这或许正是全球首个具身数据独角兽诞生的真正答案。

如果把光轮的技术路径放在更大的产业框架中观察,会发现它正在打造的具身数据平台的规模化价值,前所未有。

Image

传统的数据采集公司,本质上是“外包服务”逻辑:客户提出需求,平台完成采集,最终交付一批数据,项目结束,价值也随之终止。而在平台模式下,数据本身成为一种长期资产。光轮将人类视频数据与仿真训练资产打通,同一份数据可以在多个训练任务、不同模型阶段、甚至不同客户之间反复使用。随着仿真环境不断扩展,这些数据还可以生成新的训练样本,持续产生增量价值。

换句话说,数据不再只是一次性交付的产品,而是一种可以不断复用、持续增值的资产。当规模扩大之后,这种结构会自然形成一种商业飞轮:数据越多,仿真越准;仿真越准,生成的数据越多;数据越多,平台价值越高。这也是光轮成为“基础设施级平台”的更大价值所在。

目前。光轮也开始在全球具身智能生态中占据越来越关键的位置。在多个细分领域,公司已经建立起明显的规模优势,并在合成数据、人类第一人称视频数据以及仿真评测三个核心领域的交付规模位居全球第一。

光轮的客户名单不仅深度覆盖了NVIDIA、DeepMind、字节跳动、阿里等全球最顶尖的大模型公司,还包括Figure AI、1X Technology、智元机器人、银河通用等机器人本体厂商,以及Toyota、BOSCH、比亚迪、吉利等全球产业巨头。全球前五的世界模型团队均已与光轮展开合作。据ZP知悉,一家由顶级 AI 研究者发起的世界模型公司,在正式成立前就已主动与光轮沟通合作,希望提前锁定未来的数据交付份额。 这种现象在硅谷并不陌生。就像大模型公司会提前锁定GPU配额一样,在具身智能领域,能够稳定提供高质量训练数据的平台,也正在成为新的稀缺资源。

在更深层的合作中,光轮作为核心共建方与NVIDIA联合开源Isaac Lab-Arena基准框架,联合World Labs共建从环境生成到规模化评测的通用流水线,携手通义千问基于 RoboFinals-100构建可复现、可诊断的工业级评测闭环,共同推动具身智能评测行业基座的建立;光轮智能自研的LeIsaac仿真工作流已被全球最大AI开源社区 Hugging Face官方文档纳入,成为全球百万开发者的“仿真标配”。

当行业标准逐渐形成时,参与制定规则的公司往往会掌握更大的话语权。

从商业结果来看,这套模式已经开始得到验证。ZP了解到,光轮2025年的收入达到2024年的10倍。而在 2026年第一季度,公司预计实现的收入已经超过2025年全年。这种增长速度意味着,具身数据规模化并不仅仅是一种行业判断,而是已经开始转化为实际的市场需求与现金流。

当一家公司开始定义标准、共建底层、连接顶级客户与开发者生态时,它所代表的,就已经不只是一个赛道中的领先者,而是一层新的基础设施。如果说2026年是具身数据规模化的元年,那么光轮已经率先占据了这一轮浪潮中的数据与仿真基础设施层。

Image
Image