程序员老鬼

先动脑、后动手!Google DeepMind 发布全新机器人模型

今天刷到一个事,有点意思…Google DeepMind 又整了个新玩意儿,机器人这回不是“傻干活”,而是会先想一想再动手。对,就是那个——的节奏。

Image

简单说,它把机器人拆成了俩角色: 一个像“大脑”,Gemini Robotics-ER 1.5(VLM),偏推理层——负责想:我到底要干啥、先后顺序咋排、要不要上网/查资料/调用外部工具; 另一个像“身体”,Gemini Robotics 1.5(VLA),偏执行层——负责看(视觉)、听(语言指令),然后把这些话转成真动作,手要伸哪、夹子怎么转、走几步…反正就它动。 我说人话:一个负责“主意”,一个负责“手脚”。嗯,这结构很顺拐。

对了,它的空间理解还挺猛,在 15 个学术基准里是 SOTA(最优性能)。这事儿为啥关键?因为现实世界超鸡肋——桌子上杯子挡住了纸巾,地上有个轮滑鞋…机器人要是空间感不行,转身就摔。现在这套模型能看懂“东西和东西之间的关系”,不光是看到一堆像素点那么简单。

Image

我突然想起来一个官方示例(不要杠,脑补一下场景):你说“帮我把垃圾分好类”,这玩意儿先用“脑子”去想:我们这城市的垃圾分类规则是啥——可能还会上网查一下本地标准;然后拆解步骤:找垃圾袋→识别里面的东西→逐个归类→确认没错→打包。想明白了,再把计划丢给“身体”,身体这边就开始干:打开抽屉、拿袋子、视觉识别、机械臂夹取…干完还会复盘,用自然语言解释它为啥这么做。就…有种被认真对待的感觉,挺贴心,但也有点小恐怖哈哈。

重点不是一个机器人能干多少,而是——学到的技能能“迁移”。今天教它在 A 牌机械臂上叠毛巾,明儿搬到 B 牌小车上,它不至于完全重学。这个“跨平台迁移”以前最要命:换个硬件就像换了个物种。现在呢,大脑-身体解耦之后,通用的“想法”和“步骤”能最大化复用,身体层再做点适配就行。效率上来,落地成本就能下去,这是我觉得最值钱的部分。

Image

等等,我先说个细节…这个“身体”不是一根筋,它在动手前会“想一想”。也就是说,它不是一口气把动作吐出来,而是边看边修正:比如夹杯子的时候发现角度不对,会自己在脑子里过一遍“要不要换抓取点”。这种“先过脑→再执行→执行中再想”的闭环,才有点像我们人干活的样子,不是那种“你说一,我做一”的僵硬宏。

另外,这套东西有三个让我眼前一亮的小点(我知道我又开始碎碎念了…):

  • 复杂任务不需要你手把手教每一步,它能自己拆解,还会解释“为什么这样拆”。
  • 会用自然语言把过程讲给你听。出错也不装,直接复盘。
  • 能调外部工具。这个特别现实:家里装了啥传感器、仓库里有啥库存系统,它能自己去查,而不是等你来回喂信息。

不过这不是重点,重点是…我终于看到了那种“从 Demo 到能用”的缝隙在变窄。以前机器人视频都挺唬人,一剪梅就无敌;真上手不是掉东西就是卡在桌角。现在空间理解拉满、推理拆解更稳,“大脑-身体”分工清楚,感觉那些“最后 10% 的坑”被填了不少。当然我也不敢保证它上来就能做饭洗碗遛狗接孩子,别想太多,先把“稳定干活”做到头吧。

哦对,怕有人问:它到底牛到什么程度?一句话压缩包:

  • 15 项空间理解基准拿了 SOTA;
  • 双模型协同:Gemini Robotics-ER 1.5(推理/规划/上网/工具)+ Gemini Robotics 1.5(把视觉/语言变动作);
  • 技能可迁移到不同机器人平台;
  • 动手前会“想”,动手时会“改”,动手后能“讲”。

反正就是,这次不再是“会聊天的机器人”,而是“会干活、还能讲清楚为啥这么干”的机器人。嗯,我有点小期待,也有点小紧张。要不你想一个你最想让家里机器人替你干的活?我先点名——把我那抽屉的电池、数据线和奇奇怪怪的转接头…全都整理好,拜托了

官方介绍:deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/

-END-

我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html

最后给大家分享一份不错的副业资料,点击下方公众号,回复关键字: 副业 领取,也可以链接我领取,微信:hls404