程序员老鬼

高德发布 FantasyWorld 的世界模型,阿里的模型版图再次扩张。

今天刷到一个事,有点意思……高德(Amap)居然悄悄把“世界模型”这条线给打出来了,名字还挺中二:FantasyWorld。

我第一反应是:啊?导航 App 也开始搞“AGI拼图”了?但转念一想又觉得合理到离谱——地图这玩意儿,本来就是现实世界的“数字底座”,而且还是持续更新的那种。你想想它每天吃进去多少轨迹、路网、POI、街景、施工封路……这数据量,不拿来做空间智能,感觉都有点浪费。

Image

更刺激的是:它在 WorldScore 这个专门评世界模型的基准上,直接冲到了榜首(媒体说它“多项指标第一”)。 WorldScore 本身也挺“对味儿”的:不是只看一段视频像不像真的,而是把“世界生成”拆成一段段沿着明确相机轨迹的 next-scene 任务,去测你能不能跟着镜头移动、能不能保持 3D 一致、风格别飘、动态别崩。作者里就有李飞飞和 Jiajun Wu 这些人,属于那种“你不服也得服”的配置。

然后我去翻了下 FantasyWorld 的论文(2025 年 9 月 arXiv 那篇),它核心思路其实很“工程直觉”:别把视频模型全推倒重来,而是在一个冻结的视频 backbone 上,外挂一个可训练的几何分支,让它在一次前向里同时学“视频潜变量”和“隐式 3D 场”。 

怎么说呢,这就像你原来只会画“看起来对”的动画,现在旁边塞了个“骨架/结构”的小脑子,专门盯着你:欸你这个角度一换就穿模了啊、欸你这个桌腿怎么突然变细了……然后它还搞了交叉监督:几何线索去约束视频生成,视频先验反过来给 3D 预测兜底,最后出来的效果就是——视觉真实感还在,但多视角一致性、几何保真度明显更稳。

Image

说到这儿我突然想到最近自动驾驶那波风向变化(VLA、纯视觉、端到端……反正每天一个新缩写),还有具身智能这半年火到离谱。大家都在拼一件事:让模型别只会“看图说话”,要能在物理世界里不翻车。而世界模型恰好就是那个“把视频/图像提升成可交互、可推演的 3D/4D 世界”的关键中间层。你不一定马上就拿它去控制机器人,但你得先有个“稳定的世界”,不然你让机器狗转个身,它脑子里世界都塌了,那还怎么玩。

所以我现在看高德这步棋,感觉不像单纯“蹭概念”。更像阿里在把“地图”从工具升级成入口:从“告诉你怎么走”,变成“给你一套能被 AI 理解和模拟的真实世界”。而且新闻里还提到他们内部都开始搞具身相关组织和岗位了……嗯,这就更不单纯了。

当然我也得泼点冷水:排行榜第一很爽,但世界模型离真正落地到大规模机器人/自动驾驶,中间还有一堆坑,比如数据闭环、长时一致性、可控性、安全边界……我也不敢说 FantasyWorld 就是“那个终局答案”。但它至少说明一件事:以后“谁掌握真实世界数据”,可能比“谁文本爬得多”更关键。

对了,突然好奇:你们觉得导航 App 未来最离谱的新功能会是什么?我脑洞已经开始往“开车前先在你家小区数字孪生里彩排一遍”这种方向跑了……反正就,挺期待的。

-END-

我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html

最后给大家分享一份不错的副业资料,点击下方公众号,回复关键字: 副业 领,也可以链接我微信:hls404