前段时间,OpenAI 和微软联手扔下两枚重磅炸弹:被人千呼万唤的 GPT-4 和以迅雷不及掩耳之势发布的 Microsoft 365 Copilot。借助前者强大的图文理解、生成能力,后者把很多工作都自动化了,包括写文档,把 Word 转成 PPT,根据 Excel 数据生成图表……一时之间,AI 模型似乎什么都可以干了,但有些需要身体的活儿暂时还干不了。于是,压力来到了机器人这边。
AI 大模型加机器人会产生什么化学反应?谷歌前不久的一项研究已经给出了初步答案:他们训练了一个参数量达 5620 亿的具身多模态语言模型 —— PaLM-E,然后用这个模型来驱动机器人自主地完成各项任务。在执行这些任务的过程中,机器人必须像人一样能看、能「思考」,把眼前的状况分析清楚,然后制定行动计划并执行。比如,你可以直接问机器人:「如果一个机器人想在这里(如下图)发挥作用,它应该采取哪些步骤?」PaLM-E 可以给出答案:首先清理桌子、清理垃圾,然后挪动椅子、擦椅子,最后把椅子放回原处。对于普通 AI 模型来说,能回答出这些就已经可以了。但区别在于,谷歌这个大模型是有身体的,因此可以把上面提到的工作都做完。这就给了大家更大的想象空间。