腾讯科技

加速进化程昊:具身模型要做,但“先烈”不能当

图片

文|小燕

编辑|徐青阳

在具身智能行业,加速进化创始人、CEO程昊是一位有些“反共识”的创业者。

当行业高喊“通用场景”时,他在机器人踢足球这个单一场景上停留了足足三年;当具身大模型成为人人追逐的焦点时,程昊却认为,这是巨头的生意。加速进化选择从具体场景切入,先“挣个100亿”,把自己做成巨头,来打赢这场战争。

这些看似“慢半拍”的选择,背后是一套清晰的生存逻辑:“不做先烈”,先让公司“活下去”。

因此,在热闹而快速的机器人赛道里,程昊显得克制而安静。

在他身上,还有一种和“前沿”相反的“古老”气息——他身处最前沿的机器人赛道,却习惯回望上世纪的信息革命,从计算机和微软的发展中寻找参照,判断今天的机器人行业究竟走到了哪一步。熟悉程昊的人,对他的评价颇为一致:喜欢讲历史,尤其喜欢谈计算机和微软。在和腾讯科技的整场对话中,程昊四次提到微软,九次提到计算机,若干次提到“dos系统”,还回顾了小时候家里要通过“插电话线”来上网。

我们很好奇,在这位创业者身上,究竟发生过什么,让他如此安静地“反共识”。程昊喜欢将机器人类比为PC时代初期的计算机,如果将人类也比作计算机,程昊底层的“操作系统”是什么、又是如何运转的,他在人形机器人的“快时代”里,有哪些“慢思考”?

在进入正式对话之前,先简单介绍程昊和他的加速进化。

了解程昊,要从大学时代的机器人冠军梦说起。

2006年,他进入清华大学自动化系,加入机器人足球队“火神队”,后来成为第三任队长,并带队获得RoboCup(机器人世界杯)TeenSize季军。那时,参赛机器人从零部件到整机均由清华师生自主研发,但他始终与冠军差了一步。

2013年硕士毕业后,程昊离开机器人行业,先后进入亚马逊、创办“朝夕日历”,公司被字节跳动收购后,又担任飞书产品副总裁,管理千人团队。这十年间,他经历了大厂、创业、收购和团队管理,也逐渐意识到:技术做得太早,公司可能撑不到它成熟那一天。

直到2022年底,ChatGPT掀起生成式AI浪潮,程昊判断机器人新周期已经到来,并于2023年6月创立加速进化。此后,公司陆续推出Booster T1、K1和T2:前两款延续RoboCup TeenSize和KidSize的尺寸逻辑,将他重新带回机器人足球赛场;2026年7月发布的1.4米高T2,则将场景进一步拓展至物流配送和家庭服务。

ImageWAIC 现场。左侧:加速进化创始人、CEO程昊

01

机器人踢足球,已经到什么程度了

Q:在2026年WAIC上,加速进化的机器人完成了多次高质量的足球对抗和射门动作。它是怎么学会踢球的?

程昊:对机器人而言,踢足球构成了一个完整的任务闭环:既需要通过运动控制完成跑动和踢球,也需要依靠路径规划移动至合适位置,还需要进行上层决策,判断传球或射门、进攻或防守,以及自身与队友如何跑位。只有这些能力协同运行,机器人才有可能赢得比赛。我们将这套综合能力定义为一个Agent。

近两年,机器人足球技术进步显著。以正在训练的“大力射门”为例,我们将视觉信号端到端输入“小脑模型”,再通过强化学习,使机器人在仿真环境中持续训练。这一过程类似于修仙小说中的“异世界”:现实世界仅过去一小时,机器人却可能已在虚拟环境中训练十年,专门学习在足球与球门处于不同位置时如何完成射门。

从人类学习机制来看,这相当于通过反复训练形成“肌肉记忆”,将原本需要思考的动作转化为快速反应。这套方法同样适用于家务、物流和配送等场景,其本质都是通过高频训练形成稳定能力,使慢思考逐步转化为快思考。

Image

Q:你描述的训练过程,很像“天上一天,地上一年”。

程昊:是这个意思。

Q:从单一场景来看,机器人踢足球这套能力目前已经训练得相对成熟了?

程昊:实际上,机器人踢足球距离成熟仍然很远。我们的最终目标,是让机器人足球队战胜人类世界杯冠军,但目前与这一目标仍有很大差距。

RoboCup曾提出一项愿景:到2050年,机器人足球队能够战胜人类世界杯冠军。按照目前的技术进步速度,如果这一趋势得以延续,我们判断,这一目标有望提前实现。近两年,机器人足球的发展明显提速,其进步幅度可能已经超过此前二十年的总和。

Q:为什么机器人踢了二十多年足球,最近两年却突然进步这么快?

程昊:主要有三个原因。

第一,硬件日趋成熟和标准化,性能持续提升,仿真与真机之间的差距不断缩小。以刚发布的T2为例,其身高仅1.4米,并非全尺寸机器人,但射门速度已接近人类上限。

第二,“小脑”运动控制能力进步显著。自2019年至2020年前后,强化学习开始应用于足式机器人,机器人的运动能力迅速逼近人类,已能完成腾空翻、后空翻等高难度动作。

第三,下一阶段最大的挑战在于“大脑”,尤其是Multi-Agent协作,即多台机器人如何配合。不过,要真正战胜人类世界杯冠军,硬件仍需更加灵活,“小脑”也要掌握马赛回旋、蝎子摆尾等复杂动作。只有硬件和“小脑”等底层能力足够成熟,才有条件训练出更强的“大脑”。

02

机器人不仅仅只能踢足球

Q:如果把机器人进入不同场景比作便利店货架里的商品,那么你们上的第一个品类是踢足球,接下来两个品类就是配送和家庭?

程昊:准确地说,未来可能不只是这两个场景。T系列面向的场景还包括前台、安保等,它们的共同特点是不依赖灵巧操作。K系列除了赛事和教育,未来也可能用于陪伴,比如陪孩子、讲故事,或者陪老人聊天、提醒吃药。这些任务同样不需要机器人真正干活,也不依赖复杂操作。

我们认为,这些场景都有机会,但最终哪个场景能够率先突破甚至引爆市场,还需要不断尝试,并花时间验证。

Q:你此前一直强调,机器人应该先找到“可落地场景的最小集”,再逐步向外迭代。但目前机器人踢足球的能力距离成熟仍有差距,为什么现在已经开始拓展家务、物流和配送等新场景?

程昊:机器人踢足球的能力距离成熟仍有很长的路,但不必等到这一能力完全成熟后,再拓展其他场景。经过多年训练,机器人的硬件和“小脑”运动控制能力已进入新阶段,上层策略和“大脑”算法也有了更大的发挥空间。

更重要的是,足球场景已经验证了这套技术路线的可行性。部分硬件能力、运动控制方法和开发框架可以迁移到其他任务。因此,机器人已经开始进入家务、物流和配送等场景,尽管现阶段能够完成的任务仍然有限。

我们常将当前人形机器人的发展阶段类比为20世纪80年代的个人计算机。当时的Apple II和早期DOS计算机,以今天的标准看功能十分有限,没有Word、互联网,游戏也很简单,但正是在这一阶段,个人计算机开始进入家庭,并逐步应用于学校和科研机构。

当前的人形机器人也处于类似阶段:已经能够进入真实场景并解决部分问题,但整体能力仍在提升。现阶段的用户可能是早期尝鲜者、探索新应用的人群,或有专业研究需求的机构和个人。只要有人愿意购买和使用,就意味着市场已经开始形成。

Q:面向新场景,你们推出了Booster T2。它比T1、K1更修长、更仿人,为什么要做这样的形体变化?

程昊:T1主要用于验证硬件和运动控制能力。到了T2阶段,我们对硬件和“小脑”能力的边界已有更清晰的认识,因此开始考虑让机器人承担更复杂、商业空间更大的任务。

T2的身高由T1的约1.2米提升至约1.4米,最直接的原因是,这一高度能够覆盖桌面操作范围,使机器人具备执行操作类任务的基础。与此同时,我们并未一味追求更高、更重。现阶段,双足机器人距离在工业场景中大规模应用仍有较大差距,在研发过程中也需要频繁搬运和调试,重量过大会显著降低研发效率。

因此,T2最终采用约1.4米的身高,并将重量控制在40公斤以内,以兼顾操作能力和研发效率。

Image

Q:你们为什么会优先选择配送和家庭这两个场景?

程昊:因为它们不依赖于灵巧操作。比如现阶段的家庭机器人,还无法真正承担家务,但如果主要提供陪伴,并发挥大语言模型的交互能力,就有机会率先落地。

Q:你们内部是否梳理过一份不依赖灵巧操作的场景清单?

程昊:其实,不依赖高度灵巧操作的任务还有很多。我经常和团队举一个例子:东北有一种手套,只有大拇指可以独立活动,其余四根手指连在一起。能够戴着这种手套完成的工作,可能就是现阶段机器人可以尝试的任务。

例如工业场景中的上下料,机器人已经具备一定能力。但工业环境通常经过专门设计,如今很多工厂也在进行自动化改造,因此双足人形机器人在这些场景中未必具备明显优势。

相比之下,餐厅收拾碗筷、家庭叠衣服等任务更复杂。戴着这种手套并非完全无法完成,但操作难度更高,效率也会受到限制。

Q:加速进化踢足球的这三年里,投资人或团队有没有质疑过:别人都在做通用,你们为什么还在踢球?

程昊:这和行业本身的复杂性有关。在我们看来,具身模型与机器人的关系,类似互联网与计算机。如果不带着今天的认知回到上世纪80年代,很难判断计算机最终会发展成什么样。具身智能同样存在大量未知,例如世界模型的发展方向,即使顶级科学家之间也仍存在分歧。

因此,VC很难完全理解所有技术问题,很多时候只能通过创业者的叙事形成判断。谁能把未来讲得更清晰,融资时可能就更有优势。但我经历过上一轮移动互联网创业,最终决定公司能否做大的,仍然是技术、产品和商业模式。我们做人形机器人是长期投入,不会轻易讲尚未准备好的故事。

Q:踢了三年球,现在终于不仅仅只踢球了。

程昊:我一直认为自己做的是通用机器人,只是现阶段能够实现通用的,首先是本体、运动能力、操作系统和开发工具。例如,双足人形本体可以适配不同任务,通用运动控制器可以支持多种动作,同一套操作系统既能运行踢球、跳舞,也能支持配送、陪伴等应用。

真正实现应用层面的通用,最终仍需要足够强的具身大模型,让机器人做到“样样通、样样精”。但以当前技术水平来看,这还需要较长时间。在此之前,机器人应用依然可以先发展。就像大语言模型出现前,微信、头条、抖音等应用已经形成规模,许多需求也可以通过NLP、机器学习等技术实现。

因此,未来五到十年,机器人可能会经历一个较长的专用Agent阶段。踢球、讲故事、配送,都可以对应不同的Agent,并成为机器人落地的重要路径。

Q:这些Agent就像一个个App,运行在加速进化的机器人本体上。

程昊:这些Agent未来不只会运行在加速进化自己的机器人上。依托BoosterOS和Booster Studio,我们也计划兼容其他品牌的机器人。

这类似于微软既提供Windows,也开发硬件、Office和浏览器。对于技术复杂度较高、与系统耦合较深,同时具备入口价值和较大商业潜力的Agent,由平台自主开发,更有可能保证体验和完成度。但从长期看,平台上的大多数Agent仍将由第三方开发者提供。

Q:在具身智能赛道里,和其它激进的公司相比,你们的路线算保守的?

程昊:我们并不保守。面对资本市场,我们确实更克制,只讲能够落地和交付的事情;但在实际推进上,我们并不慢。2023年行业里很多公司还停留在Demo阶段时,我们已经要求硬件、系统和Agent能够交付,让用户拿到产品后真正开发和使用。

Q:这是一种“慢就是快”的决策。

程昊:对,因为我也创过一次业,知道所有讲出去的故事,最后都要实现;如果实现不了,大家就会觉得你是在骗人。

Q:T1已经升级到了T2。未来,K1也会继续迭代升级吗?T1还会担任其它角色吗?

程昊:K系列和T系列都会保持稳定的迭代节奏,未来可能还会越来越快。就像现在的iPhone基本每年更新一代,我觉得机器人最终也可能形成类似的节奏。

在产品定义上,我们按照尺寸分为三个系列:KidSize、TeenSize 和全尺寸产品。

KidSize现阶段能够落地的场景主要是赛事和教育,但我们认为它的终局是进入家庭,陪伴孩子和老人,就像家里多了一个“硅基孩子”。TeenSize目前主要面向科研,未来也可能进入家庭,承担收拾房间等家务。

全尺寸产品,我们也很早就开始研发,但没有急于商业化,因为目前还没有看到真正形成闭环的落地场景。

Q:这三个尺寸的分类,和RoboCup采用的组别划分是一致的。

程昊:非常一致。我们一推出这套产品命名,所有参加过RoboCup的人几乎立刻就能理解。K1、T1、A1分别对应不同尺寸,不需要额外解释,大家一看就知道是什么意思。

Q:你们现在出货量怎么样?

程昊:去年我们的订单量约为1000台,营收超过1亿元。今年上半年,无论订单还是营收,都已经超过去年同期。

不过,我们的业务有比较明显的季节性。去年上半年只占全年业务的20%多,主要订单集中在下半年,尤其是第四季度。因为客户主要来自科研和教育领域,采购更多依赖年度预算,通常会在年底前集中执行。整体来看,今年上半年的出货量同比增长了700%以上,接近800%。

03

什么时候才去讲具身大模型的故事?

Q:聊了这么长时间,你多次强调本体的运动控制功能。但在具身智能最热的话题已经转向模型的当下,你们依然没有单独去讲模型。这种节奏是不是有一点“慢”?

程昊:我们判断,具身智能与机器人行业大致会经历三个阶段:本体时代、Agent时代和模型时代。

当前处于本体时代后期,本体能力逐步成熟;下一阶段将进入Agent时代,围绕儿童陪伴、物流配送等具体场景,出现大量应用,就像智能手机早期,一个记事本或闹钟功能也会衍生出众多产品。

因此,企业现阶段既要跑通本体商业模式,也要为Agent时代做好工程准备。但从长期看,真正决定行业格局的将是模型时代。我们认为,具身模型会成为这一轮AI革命的重要能力,最终胜出的公司可能成为时代赢家。

不过,重视具身模型,关键不在于谁先提出概念,而在于谁最终将其做出来。云计算在上世纪90年代已被广泛讨论,但真正推动其产业化的是Amazon和AWS,此后也主要由科技巨头持续投入。

具身模型可能遵循类似逻辑。当前算法路线仍不明确,未来每年可能需要上百亿元投入,并依赖长期的资金、算力和顶级人才支持。即使初创公司率先实现领先模型,也可能面临巨头高薪挖人、开源模型等竞争。

因此,我们已经投入人才研发具身模型,但现阶段更重要的是,在模型真正爆发前,先形成足够的公司规模和资源能力。真正把模型做出来,比提前讲出来更重要;即使提前判断出最终算法,也未必能成为最后的赢家。

Q:在具身模型爆发前,你们要先成为一家巨头?一家机器人公司达到哪些标准,才算真正成为了巨头?

程昊:最典型的标准,是一家机器人公司每年能够产生数百亿元利润。只有形成足够强的盈利能力,才能将利润以及二级市场融资持续投入具身模型研发。

具备这种盈利能力,通常也意味着公司已经拥有成熟的产品、渠道和平台能力。微软就是一个可参考的案例:它从一家小型创业公司起步,依靠操作系统、Word和浏览器逐步成长为巨头。虽然进入云计算较晚,但如今已成为仅次于AWS的第二大云服务商。

Q:加速进化要做巨头,首先要实现每年数百亿元的利润。

程昊:这是底线。

Q:你们现在的利润是多少?

程昊:目前公司距离每年数百亿元利润还很远,但这并不是现阶段的核心目标。现阶段我们更关注TPMF,即Technology-Product-Market Fit。

因为,当前技术尚不足以支撑大规模利润,更重要的是持续提升技术和产品能力,使产品逐步进入更大的市场。这个过程类似于字节跳动的产品从“内涵段子”走向“头条”,再从“头条”走向“抖音”。这也影响了我们对创业路径的判断。早期团队应先找到一个细分市场,并在其中建立领先优势。

这个市场要么与未来大市场所需的核心能力一致,能够帮助团队积累技术、产品和软件框架;要么本身具备成长为大市场的潜力。创业初期资源有限,直接进入巨头环伺的大市场并迅速胜出的概率很低。

Q:总结起来,你们的路径是先跑通场景,再卖个几百亿,成为巨头,再进入具身模型时代。

程昊:对,但仅靠单一场景,很难支撑公司成长为巨头,这也是我们选择做平台的原因。通过平台降低开发门槛,联合生态伙伴和开发者共同拓展更多市场,并在这一过程中逐步积累公司的技术、产品和商业能力。

Q:按照你的判断,加速进化大概需要多长时间,才能成长为这样的巨头?

程昊:微软成长为巨头用了二十多年。相比之下,这个时代的节奏会更快,我认为加速进化可能在五到十年内具备这样的机会。

Q:你会担心五到十年太晚吗?毕竟现在已经出现了不少具身模型公司,其中一些已成为独角兽。

程昊:要成为具身模型的最终赢家,很可能首先需要具备巨头级资源:要么依靠自身业务创造足够利润,要么通过大规模融资,获得不亚于巨头的投入能力。

OpenAI选择了后一条路径,通过与微软合作,在大模型这一单点上的投入达到巨头级别。如今不少模型公司也在借鉴这一模式,通过持续融资重注具身模型。

但我们的判断是,具身模型目前还没有到“OpenAI时刻”,甚至可能尚未到“Transformer时刻”。这意味着技术仍处于早期探索阶段,投入的时间和资金可能远高于大语言模型。大语言模型至少拥有互联网数十年积累的数据基础,核心问题是如何清洗和利用;而具身模型需要什么样的数据,目前仍没有明确答案。

过去一两年,行业曾普遍关注遥操作数据,Aloha出现后,许多公司沿着这一方向推进;如今重点又逐渐转向第一视角数据,也说明数据路线仍在持续演进。因此,现在是否适合投入巨额资金,在具身模型这一单点上持续下注,仍然难以判断。我经常提醒团队,要避免在诺基亚时代做抖音,也不要在拨号上网时代做云计算。入场时机非常重要,过早进入,可能成为先烈。

如果我们是一家研究机构,现在一定会全力研究具身模型。这个领域存在大量未知,也有大量“低垂的果实”等待探索,是难得的研究机会。Aloha就是一个典型案例:几年后回看,它的技术可能并不复杂,但在当时带来了重要突破。

但公司的目标不同。我们希望成为具身模型时代最终的赢家,而不是只取得阶段性技术突破,因此需要选择更合适的入场时机。

这是我的第二次创业。一级市场估值和资本环境很重要,会影响公司发展,但并非决定性因素。我们对当前路径有较强信心,认为沿着确定性更高的方向持续积累,才更有机会成为具身模型竞争中真正有实力的玩家。既然已经找到一条通向终局的路径,寻找更快的路径并不是当前最高优先级。

Q:现在你们的策略是,一边做本体和Agent,一边等待可以摘采的“果实”。

程昊:低垂的果实确实有价值,但也会分散精力。我们的目标始终是最上面的那个东西。

Q:从整个行业来看,你判断现在这批具身大模型公司中,会不会死掉一批非巨头企业?

程昊:这我就不知道了。(笑)

对初创公司来说,活下去的方式有很多,也可以通过转型延续发展。我们刚创业时,行业里有不少机器人公司,如今有的已经转向其他方向,有的被上市公司收购。这是否算“死掉”?我认为未必。

现在不少具身模型公司也是从自动驾驶转型而来。未来即使再次调整方向,也不能简单视为失败或退出,更准确地说,这是企业发展过程中的一种选择。

Q:回顾你的经历,你似乎一直在避免做与时代错配的事情,更强调对入场时机的精准判断。

程昊:其实我很愿意做这类超前的事情,只是做得太早,公司往往难以生存。第一次创业时,我想做智能助理。虽然当时已经有机器学习,也出现了Siri和Google Assistant,但现在回看,技术条件仍不成熟。

比较幸运的是,我们后来找到了可行的商业模式,公司得以继续发展。但受限于当时的技术,无论如何努力,也很难真正做出足够好的智能助理。

Q:很多所谓的时代红利,往往要在事后回顾时才能看清。真正身处其中、享受到红利的人,当时未必意识得到,很多时候也有偶然性。

程昊:是的。

Q:你更倾向于冷静判断时代机遇,尽量找准入场时机?但这种判断本身并不容易。

程昊:人不可能始终保持完全冷静,但在大的战略方向上,需要足够冷静和笃定;真正面对眼前机会时,有时也会“上头”。这本质上是一种权衡。

Q:比如有没有什么事情,是你明知道时代还没到,但还是会很“上头”?

程昊:做创新,长期方向上要足够冷静和笃定,但面对即将出现的机会,也要保持敏锐,并提前投入验证。可以同时尝试两三个方向,类似做AB Test。

例如,我们已经开始围绕机器人进入家庭和配送场景进行研发。现有技术距离真正落地仍有不少差距,但我们判断,未来一两年、两三年内可能出现突破。对于这样的近期机会,如果等到完全看清楚再行动,可能已经错过窗口。

而且,这类场景越接近落地,越依赖工程化积累。我们始终认为,工程化能够形成壁垒,虽然这种壁垒并非不可突破,但确实存在。算法很难长期保密,核心人才也可能被高薪挖走;工程体系则由数十万行代码和长期调试积累构成,即使拿到代码,也很难迅速理解和复现。

因此,对于未来一两年可能出现的机会,需要更积极地提前尝试。等到方向完全明确再进入,往往已经来不及。

Q:入场时机只能判断一个大致区间,很难精确到某个时点。这其实也解释了为什么你们在具身模型上的保持相对“慢”的节奏。

程昊:我们并不认为自己在模型上做得慢,只是相关进展尚未对外公布。我们目前训练具身大模型的思路,可能更接近正确方向,其中一个核心判断是坚定探索多模态。

人本身就是多模态的。当前许多模型仍主要依赖视觉,但如果一个人失去触觉和听觉,即使完成拿笔、拧瓶盖、拿水等简单动作,也会变得十分困难。相比只依赖视觉,同时具备听觉、触觉和更敏锐的力觉,完成任务的能力会完全不同。

因此,我们判断未来的具身大模型一定是多模态的。具体采用什么算法、如何实现落地,过程中可以结合 VLA、世界模型等方案,但多模态会是我们长期坚持的方向。

Q:那么,在具身大模型上,你们已经做了哪些事情?

程昊:我们成立了独立部门Booster Lab,由首席科学家赵明国老师全权负责。团队中不少成员来自清华火神机器人足球队所在的实验室。过去大家主要研究机器人足球,如今实验室的方向已转向Manipulation,尤其是全身操作和具身模型相关研究。我们对标DeepMind,它不需要背负盈利压力,专注最前沿的具身模型,攻坚算法和技术。

我们还计划与清华大学具身智能与机器人研究院成立联合实验室,由公司投入资金,结合清华的人才和科研力量,共同研发未来的具身模型。

现阶段,具身模型仍处于需要算法创新和技术突破的阶段,因此相关研究主要由Booster Lab承担。我们希望将其建设成类似DeepMind的研究实验室。虽然目前规模和成果与DeepMind相差很远,但目标和定位十分明确:Booster Lab不承担产品落地、盈利和商业模式验证,而是聚焦最前沿、最具挑战、未来价值最高的算法方向,对具身模型进行长期技术攻关。

Q:现在行业谈到具身大模型,通常会把瓶颈归结为两点:一是稀缺的高质量数据,二是模型架构。Booster Lab更侧重于先解决哪一项瓶颈?

程昊:模型架构本身就是算法,而算法和数据是相辅相成的。经常有人问,究竟是算法重要,还是数据重要?我觉得这就像问人到底是喝水重要,还是吃饭重要,本身没有太大意义。

现在的算法基本都是数据驱动的,既然是Data Driven,就一定需要大量数据。大语言模型出现之前,并不是没有数据。那时已经有互联网文本,也有大量代码数据,因为所有网站和 App 都是由代码写成的。真正缺少的是一套能够有效利用和清洗这些数据的算法。大语言模型出现之后,大家逐渐知道如何用好这些数据,才训练出了今天的大模型。

所以,算法和数据本身就是一体的,无法割裂,也没有哪个更重要。对于具身模型来说,无论是解决数据问题,还是探索模型架构,都有价值。这个过程一定是循序渐进的,需要不断取得阶段性成果,而每一个阶段都同时依赖算法和数据。

现在有时会出现一种情况:做数据的人强调数据更重要,做算法框架的人强调算法更重要。但从行业发展的角度看,两者其实缺一不可。

04

和王兴兴志同道合

Q:现在国内外的人形机器人公司里,你分别最欣赏哪一家?国内先说。

程昊:本体还是大脑?

Q:都可以。

程昊:我其实没想过这个问题,这个问题有点像小时候被问“你的偶像是谁”,但我好像一直没有这样的思考方式。我更倾向于看不同公司和团队分别为行业做出了什么贡献。

比如在本体和运动控制方面,波士顿动力依然是一家非常重要的公司。虽然它在商业上未必特别成功,也经历过多次转手,但它在人形机器人本体和运控方式上,确实为行业做出了巨大贡献。

在算法方面,像苏黎世联邦理工学院相关实验室,将强化学习应用到足式机器人上,也推动了行业发展。至于具身模型,目前还很难判断哪一种算法会成为真正关键的突破。但我认为,只要是在做原创性探索,都有可能为行业带来很大价值。

Q:你曾经说过,在国内的人形机器人公司中,无论是本体能力,还是产品和商业化水平,真正能和加速进化放在一起比较的,可能只有宇树。

程昊:从创业第一天起,几乎所有投资人都会问,我们最认可哪家公司的路径。我们的答案一直是宇树。

刚才没有提到宇树,是因为前面谈的是技术贡献。我们本身是技术出身,早年看到波士顿动力时,确实有一种“凡人见到神”的震撼。但如果从产品和商业角度看,我们认为宇树过去选择的路径是正确的:把更多精力放在本体上,扎实推进能够落地的场景,也扎实跑通商业模式。这与我们的做事思路高度契合。

当然,我们在产品路径上也有不同。比如,我们还会做操作系统和开发工具。公司成立之初,一半成员来自机器人领域,主要是清华的师兄弟;另一半成员则来自开发工具、软件和 SaaS 领域。我们判断,接下来操作系统、开发工具和生态建设会非常重要,这是我们与宇树不同的地方。

但从如何真正经营一家机器人公司、为行业创造价值,并最终成为一家有机会长期发展的企业来看,我们认为宇树走的是一条正确的路。

Q:你上一次和王兴兴见面是什么时候,大概聊过什么?

程昊:应该是工信部人形机器人相关标准的会议上。更多还是闲聊,也会讨论一些具体的硬件技术方案。比如,电机怎样才能做得更强?现在普遍采用的 QDD 关节,在我们看来已经逐渐遇到瓶颈。

接下来或许可以借鉴新能源汽车上的一些电机方案,但这样又可能带来成本的大幅上升。性能和成本之间如何平衡,我觉得是一个很有意思的话题。

05

一个爱用上个世纪故事类比机器人的“中登”

Q:机器人行业越来越热,创业者也越来越年轻,你会有年龄压力吗?

程昊:你指的是我们这批“老登”有没有压力,对吧?(笑)

Q:“老登”不至于,可能是“中登”。

程昊:我觉得还好,我们公司里确实有不少 85 后、90 后,但现在新入职的同学很多都是刚毕业,也非常年轻,已经成为主力。不同年龄和经历的人,为公司贡献的东西不一样。

有经验的同学,更多是帮助公司在战略上少走弯路。这个行业现在非常热,也非常激进,短期诱惑很多。经历过更多挫折、踩过更多坑的人,在判断上可能会更谨慎一些;年轻同学则往往更有冲劲。

我觉得一家好的公司,既要有人踩油门,也要有人踩刹车。前方是直道、风险不高时,油门就应该踩到底;但根据经验判断,接下来可能会翻车时,也要适当踩一踩刹车。没有哪场比赛能够一路把油门踩到底。

Q:我观察到一个细节。今天整个谈话里,你提到了很多次微软,也提到了好几次 DOS。你做的是最前沿的人形机器人,却总喜欢用上世纪互联网的发展来做类比。为什么这些故事到今天还会影响你的思考?你会不会担心,对于很多年轻人来说,它们已经有点“古早”了?

程昊:我其实不担心,只是一直想找一个更接近的类比。过去很多人把机器人比作自动驾驶、新能源车或智能手机,这些类比的出发点,是让非专业人士更容易理解,但我认为它们都不够准确。

比如,智能手机出现之前,手机已经存在。消费者购买智能手机时,至少知道它可以打电话、发短信,应用场景是明确的。但机器人不是这样。自动驾驶在我看来更像一个 Agent,如果拿它和机器人相比,就像拿一个 App 去类比整个信息革命,两者并不在同一个层级。

新能源车则更像一种专用机器人,它和通用机器人的关系,有点类似单反相机和智能手机:手机是通用设备,单反是专用设备。手机也可以拍照、录像,但并没有消灭单反,二者面向的是不同需求,也都有各自的市场。因此,很难通过单反的发展去推演智能手机,同样也很难通过新能源车或自动驾驶去推演机器人。

机器人与具身智能的机会太大了,我认为它更接近一次工业革命级别的变化。若要找一个距离今天最近、逻辑上也更匹配的类比,可能是信息革命的开端。

计算机刚出现时,人们也会质疑:它做的不就是计算器能做的事吗?为什么还要选择一个更贵、更重的设备?但计算机的关键在于它具有通用性,后来在其上出现了操作系统、软件和互联网,能力和应用不断生长。

所以,机器人真正值得期待的,不只是完成某一项具体任务,而是作为一种通用平台,未来可能长出操作系统、软件和完整生态。从这个角度看,它更像信息革命初期的计算机,而不是某一种已有产品的升级版。

Q:现在智能化发展得越来越快,会不会有一天担心没有历史可以对比了?

程昊:具身智能是真正没有历史可以直接对照的新事物。我们在做具体判断时,并不会照搬计算机发展初期的路径,那样无异于刻舟求剑。

之所以会拿信息革命初期来类比,只是因为在解释战略方向、说明为什么要这样做时,需要找到一种能让大家快速理解的表达方式。就现有经验而言,信息革命初期是逻辑上最接近的类比,但它并不是一套可以直接照搬的方法。

Image

推荐阅读

Image

暴走三万步,看机器人的四个变化 丨WAIC现场

Image

人形机器人进化:首先“卷”向一双手

Image
一键关注,明天见看完点个爱心点个赞