强化学习之父Richard Sutton:通往AGI的另一种可能
2019年,强化学习之父、阿尔伯塔大学教授Richard Sutton发表了后来被AI领域奉为经典的The Bitter lesson,这也是OpenAI研究员的必读文章。
在这篇文章中,Richard指出,过去 70 年来,AI 研究的一大教训是过于重视人类既有经验和知识,而他认为最大的解决之道是摒弃人类在特定领域的知识,利用大规模算力才是王道。
这一思想很快得到了OpenAI首席科学家Ilya Sutskever的共鸣,某种程度上,它也启发了大模型领域所信奉的Scaling Law。
有趣的是,Richard认为,通过语言大模型方向来实现智能没有前途,他更赞同Yann LeCun关于世界模型的构想,这在目标与核心概念上与其主导的阿尔伯塔计划(Alberta Plan)相一致,尽管不过在具体实现方法上有所区别。
在他看来,实现AGI需要明确的目标和一个世界模型,并利用这个模型来制定行动计划以实现目标。
Richard Sutton研究人工智能已长达45年。他非常想弄清大脑的运作方式,为此做了大量跨学科研究,阅读了不同思想家对这一问题的看法,并试图从心理学入手,以找出大脑和计算机科学的运作方式。
在Craig Smith近期主持的一期播客中,Richard详细介绍了阿尔伯塔计划,目标是打造一个能够从与环境的交互中学习并做规划的具身智能体,这是一个宏大的五年计划。此外,他还深入分析了新算法的发展现状、模拟环境和真实环境之间的权衡以及通用人工智能(AGI)的终极目标。
Richard还谈到了与传奇工程师John Carmack的合作。2023年10月,Richard加入了后者创办的AI创业公司Keen Technologies并担任研究员,这家公司旨在2030年实现AGI。
因此,简化世界并充分理解始终是我研究的一部分,就像物理学家可能会假设一个简化的世界,让一个球沿着斜坡滚动,消除了摩擦力和其他种种影响。
语言大模型并没有真正理解它们的目的,只是表面上似乎做到了这一点,但特殊情况总是会出现。如果一个人工智能系统在一段时间后做出不符合的目标,那将不会成为一位有用的助手。因此,语言大模型虽然非常有用,但它们同时也存在相当严重的局限性,这并不是批评。