TimYang

预测next state而非token世界模型在赌什么

最近断续听一期7小时的播客:张小珺对谢赛宁的长访谈。谢赛宁是NYU教授,何恺明长期合作者,DiT的共同提出者,刚和图灵奖得主LeCun一起创立了AMI Labs,25个人拿了10.3亿美金的Seed轮。
这期播客特殊之处不是因为融资数字,而是谢赛宁提出了一个不同于主流的判断:硅谷被LLM催眠了。
他的核心论点是:语言不是思考的工具,而是沟通的工具。LLM本质上是在一个高度人工化的符号系统里做pattern matching,这其实违背了Rich Sutton那篇著名的Bitter Lesson。
这让我想到开发中的一个直觉:AI写代码越来越强,但它对物理世界的理解几乎为零。你让它写个排序算法没问题,但让它理解一杯水倒扣在桌上会怎样就抓瞎了。谢赛宁说,造一只松鼠的智能比上月球更难,这话听着夸张,但你仔细想想,松鼠要实时处理视觉、平衡、规划、恐惧,全部在一个几克重的大脑里完成。
AMI要做的世界模型说白了就是:给定当前状态和一个动作,预测下一个状态。这不是predict next token,而是predict next state。听起来简单,但个人觉得还是有非常大的实现gap,甚至短时间不一定能达到。
当然世界模型是个发展中的事物,LLM派通常认为语言是人类文明进化的最高级压缩方案,LLM模型已经自动习得了物理世界的运行规律和因果逻辑。
对开发者来说,这期访谈有几个值得思考的点:
第一,Chain-of-Thought可能是个过渡产物。谢赛宁指出CoT的推理步骤经常是事后合理化,并不忠实反映模型的真实决策过程。这对我们评估AI辅助编程的可靠性有直接影响。
第二,他两次拒绝Ilya Sutskever,核心分歧在于对视觉和多模态的重视程度。这个选择本身就是一个career lesson:在所有人都在追同一个方向的时候,敢于押注不同的路径。
第三,"研究从来不是线性的,线性的研究过程一定不是好的研究。"这句话对做技术的人同样适用,如果你的项目太线性,大概率你没在解决真正难的问题。
访谈里他还推荐了两本书:《集异璧之大成》和《禅与摩托车维修艺术》,说"有些书会把你装满,有些会把你掏空"。另外推荐的几部AI寓言作品也很有意思:《POI》、《万神殿》、《无可奈何》,滑到图片最后几页可看完整书单。
最后聊到"世界是一个巨大的世界模型吗?我们能预测命运吗?"谢赛宁的回答是最终的答案可能是42(这个梗应该来自银河系漫游指南)。他接着说了一句让我意外的话,留在最后一张图片。
访谈可在小宇宙或youtube等平台搜:谢赛宁