如果智力是某种压缩算法,语言大模型就无法通向 AGI
先叠个甲,本文没有任何的实用价值,仅仅是纯粹的智力活动。观点也未必对,您先消消火。
最近在看 Ilya 的访谈,其中一个观点是:“如果你能很好地压缩数据,就必须揭示其中所有隐藏的规律。”
这句话我理解为,智力相当于某种高级的数据压缩算法。
他还说:“泛化能力是压缩的副产品。”
在我的理解中也是同一个意思:智力越强,泛化能力也越强。
我对其中蕴含的哲学思想非常感兴趣,上周与朋友进行了长谈,谈话结果与我之前的观点一致:当前技术路线无法通向 AGI。
首先引用杨立昆的观点:
我来给大家做个简单计算。一个典型的大语言模型的训练数据量约为 20 万亿个 token(即 200000 亿个 token)。token 大致相当于一个词,通常用 3 个字节表示。因此 20 至 30 万亿个 token,每个 3 字节,总数据量约为 10¹⁴字节(即 1 后面跟 14 个 0)。这正是互联网上所有公开可用文本的总量。而一个幼童在 4 年内所接收的信息或数据量,就与最大规模的大语言模型相当。
这个道理很清晰,人类获取的信息量巨大,4 岁幼童获取的信息量即可与互联网上公开文本的总量相当。因此,语言大模型缺乏足够的语料去模拟和理解更完整的人类世界。语言的边界,就是语言大模型技术路线的边界。语言大模型不可能通向 AGI 之路(冤有头债有主,反对这个观点你去找杨立昆 battle)。
接下来,Ilya 的另一个观点给了我更多启发:
人类的价值函数在很大程度上是由情绪以某种重要方式调节的,而这种调节是由进化硬编码的。
情绪扮演着稳健的 “价值函数” 角色,提供了当前 AI 仍缺失的关键学习机制。
这个观点听上去云山雾罩的,但接下来他举的一个例子优雅地进行了诠释:
一名青少年大约只需 10 小时就能学会驾驶,所需的数据量仅为人工智能所需数据量的极小一部分。学习开车时,他们能对当下驾驶的糟糕程度、危险程度、不自然程度形成一种整体的主观判断。这种判断极为稳定,不会因几次偶然的成功或失败就剧烈波动。人类的情绪在这里扮演着关键角色 —— 它是一种稳健的 “价值函数”。
人类价值函数的惊人之处在于其鲁棒性:“我能感知到问题的存在” “我有自己的判断”。他们无需正式的奖励信号就能自我纠正 —— 只要感觉到自己压线、操作失误,就会立刻调整。这正是当前人工智能欠缺的样本学习效率。
要达到更高层次的智能,人工智能系统需要学会像人类一样高效地实现泛化。
基于以上的专家发言,我做了一些延伸思考。
杨立昆已经论证了人类世界的信息量巨大。被语言记录下来的信息,只是冰山一角,没有被各种类型的语言(含图像/音频/视频)留存下来的信息,是信息宇宙里的暗物质,这个观点在过去两年被我多次提及。
这里的关键点是什么呢?
是注意力。
人类并没有去关注和运算如此巨大的信息量,而是本能地把注意力集中在当下更重要的信息之上。
这种分配注意力给重要信息的方式,就是我理解中 Ilya 所说的 “压缩数据”。
分配注意力的方式,我认为有如下几种:
感受,和 Ilya 举例青少年如何学习驾驶类似,学习驾驶过程中的感受会帮助他高效率地分配注意力
情绪,情绪微妙的波动,是感受下一阶段的产物,进一步提高了分配注意力的效率
动机,更深层次的源头,影响注意力的分配方向
经验,也是我之前在聊聊什么是“专家的直觉”一文中描述的,由体感堆积而成的直觉,在思考和行动时出于直觉快速准确抓重点
籍由动机/感受/情绪/经验,人类得以在茫茫数据中,“压缩” 得到最重要的数据,把主要的脑力集中在极少数的数据上进行运算。
这就是智力。
智力越高的人,大脑能记忆和理解的信息更多,尤其是抓重点的能力越强,从更多信息中抽象出更精炼和更关键的信息。
我举两个例子。
第一,我在专长领域阅读时,一定是一目十行的,几千字飞快就看完了。对我来说,大部分内容都是废话,水贴,但我能敏锐地注意到比如说五千字文章里,对我来说最重要,最有启发的可能就一两百字,停留在这一两百字上反复琢磨。
第二,新手做产品分析时,会画一张大而全的脑图,把所有页面结构和功能结构刻板地描述一遍。而我花 5-15 分钟看完一款新产品时,会直接告诉你,产品定位和竞争力是什么,特色和短板是什么。
这就叫抓重点。
和大模型运行相比,大模型输入几千上万字的 token,逐字细读并总结。但一些研究发现,如果 token 太多,大模型可能只有细读前 10% 的耐心,后面 90% 内容的总结越来越水。
那么,如果大模型具备人类抓重点的能力,比如输入五千字文章,把算力集中在重点的一两百字反复 “琢磨”,算力用在刀刃上,是否就有可能如 Ilya 所说,“揭示其中所有隐藏的规律” 并实现泛化?
遗憾的是,这个思考方向与当前大模型的技术路线差异很大,它可能更接近 AGI,但按这个方向迭代技术路线需要漫长的时间。我甚至不确定我死之前能不能看到真正意义上 AGI 的诞生。因为 “动机/感受/情绪/经验”,任何一样出现在机器身上都很科幻。情绪是人类的价值函数,怎样让 AI 也能实现类情绪呢?情绪的背后是 1、深层次的动机,2、对机器来说不可理喻的感受,3、信息/动作/反馈三者交互产生的体感(经验来自于体感)。
情况大致就是这么个情况。
继续按现有技术路径扩大规模(堆算力、堆数据、堆训练环境),仍会带来持续改进,这种进步不会停滞。但即便如此,某些重要的东西依然会缺失。无论你如何扩大规模,有些东西终究无法获得。
按照上下文语境,“有些东西终究无法获得”,指的是缺少情绪这个价值函数,那么更高级的智力,尤其泛化能力终究无法获得。
还有一种可能是,高质量的数据压缩也是人类创造力的根源(精确地从 “特定信息组合” 中推导出创造性结论)。
哪怕我们不谈论 AGI 这种云山雾罩的事情,如果缺乏泛化能力,在我的理解中,AI 在绝大多数领域无法达到 80 分向上的,准专家级别的智力水准。但 60-70 分的智力活动在大多数情况下,并不能直接转化为可销售的商品,或者说 60-70 分并不构成商品销售的核心竞争力。但凡不稀缺的东西都不可能是商品竞争力。
这恰恰是 AI 当前阶段最痛苦的一件事,广泛提升的效率并没有转化为广泛的商业需求,也没有转化为广泛的商业价值。AI 信仰者相信随着智力提升,解决问题的程度也可以如摩尔定律一般线性外推的(缺乏逻辑论证的线性外推是一个经典骗局),AI 能力不断增长,最终创造大量的商业需求与商业价值,甚至还有可能几个虎跳几次涌现,几年内达到 AGI 水平。
在此最后一次引用 Ilya 的原文:
目前关于这些模型非常令人困惑的一点。该如何解释它们在评测中表现如此出色这一事实呢?你看看那些评测,难度相当高,它们的得分也很好,然而其经济影响(商业转化)却明显滞后。
如果未来五年揭晓的事实是,商业转化持续滞后,AI 并没有创造更多的岗位,而是因为效率提升消灭了更多的岗位,失业者增多带来了消费力下降,那么 AI 整体上正在削减商业需求,把全世界大踏步带入通缩时代。
妈妈,我有点害怕。
点击【阅读原文】,可见犬校最近一年的好帖索引。