VPP入选ICML2025 Spotlight!清华、星动纪元开源首个AIGC机器人大模型
“来碗热乎的鸡汤吧。”过去你说这话,AI能给你整出一个鸡飞狗跳、感人肺腑的视频剧本。但现在,这话要是对着你家客厅里那台新买的机器人说,说不定它真能端碗热汤来。这不是科幻片情节,而是实打实的科技落地了。
我一开始看到这个技术的时候,还以为是哪个 AI 视频生成又出新花样了,结果一看,是清华叉院和星动纪元整出来的机器人大模型 —— VPP(Video Prediction Policy),直接在 ICML 2025 拿了 Spotlight 奖,简直是机器人界的“Sora”。有图有真相。
AIGC 不止造梦,现在能造动作
这模型牛在哪?你还记得 AI 视频模型 Sora 吧?靠着扩散模型玩得风生水起,生成视频跟电影一样精美。现在这个 VPP 就是把“生成视频”这事,直接让机器人模仿起来了。别再手写动作脚本了,喂个视频进去就能让机器人学会动作,这效率不比程序员亲自调试高多了?
更神的是,VPP 不光学得快,还能通用不同类型机器人。你今天给个双足人形,明天换成机械臂,它都能一键适配,简直像是“机器人GPT”,全能型选手。
机器人也能“提前看答案”?!
以前机器人执行任务,先看环境再慢慢理解你说了啥,边想边动,像个刚醒的大学生,慢吞吞地干活。而 VPP 不一样,它能预测未来的场景,你刚说“给我倒杯水”,它脑海里的视频已经演完了——手伸过去,瓶子拿起,杯子倒满。这操作熟练得像是在抄答案,当然就比别人快。
预测和执行的结果基本一模一样,就像你看电影里的动作场景,机器人直接照着演。
动作不但准,还快得飞起
之前的视频生成模型虽然好看,但推理时间拉垮,一段视频能生成个几分钟,你人都等得快睡着了。VPP 则是把视频生成的中间过程做了优化,直接提取最有用的信息,一步预测未来几帧,然后马上行动。
单步预测只要 150ms,控制频率能到 50Hz,机器人动起来比我打字还快(真的,我敲个回车得0.5秒),而且不卡顿、不宕机。
不同机器人间“知识共享”,无缝衔接
这点让我有点羡慕了——人还要用翻译软件交流,机器人却已经能无障碍跨设备学习。VPP 直接甩开了传统模型的限制,不管是仿人机器人还是机械臂,甚至你的视频里是人类本体都没关系,它都能学。
反正你只要能把动作录成视频,它就能学个八九不离十。低成本、高效率,把一整套机器人训练流程从“编程”升级成“看视频就会”,AI打工人的春天来了。
不是吹,测试成绩是真的猛
在行业标准 Calvin ABC-D 的测试里,VPP 拿了 4.33 的平均任务完成分,几乎满分。而同类模型只能混个 3 点几,差距不是一点点。
不止仿真环境,它在真机测试上也表现出色,67% 的成功率,其他模型看了直接沉默。
实战中的全能选手,干啥都行
这个模型不是只会做实验室里的搬砖任务,在真实环境下,VPP 在 XHAND 这个五指灵巧手平台上一口气做了上百种任务:抓东西、堆积木、倒水、拿工具……说实话,这些活儿换我我都不一定干得过它。
在双臂人形机器人平台上,它也能搞定 50 多种复杂操作。我们还在教孩子绑鞋带,VPP 已经能用两只“手”配合组装玩具了。
可解释性让调试不再靠玄学
最后一点特别实用:你不需要一直等机器人真机执行失败才去修它了。VPP 生成的视频预测本身就能看出哪里可能出错,提前规避,省下大量调试时间。相比之下,那些 VLA 模型只能靠真机碰撞测试,调一次出汗三次。
我的一点感想
说真的,从我最开始写 AI 技术相关内容到现在,见过无数“黑科技”模型,但能让我在一分钟内脑补出“机器人像人一样理解世界并执行任务”的模型,VPP 算是第一个。
而且它不仅是炫技,还真把复杂的感知-理解-执行流程简化了,大大提高了可落地性。开源的部分也做得很良心,完全可以作为从学术到产业转化的典范。
不吹不黑,如果你对机器人操作有兴趣,或者本身就做这方面的研究,VPP 的项目主页和代码仓库值得你一键三连:
未来也许真不是我们养机器人,而是机器人照顾我们了。你说,现在是不是该去给自己整一台“VPP 上岗”的 AI 小管家?
也可以看我写的这篇文章《DeepSeek满血复活,直接起飞!》来进行本地搭建。
-END-
以上,就是今天的分享了,看完文章记得右下角点赞,也欢迎在评论区写下你的留言。