Ilya Sutskever:AI 研究、泛化与未来之路
文章整理自 “Ilya Sutskever x Dwarkesh Patel 播客”,时长约 1 小时 36 分,因内容过长,我拆成了两部分,速读和深度版。原视频可在 YouTube 观看(Ilya Sutskever – We're moving from the age of scaling to the age of research[1])。特别建议大家花时间读一下深度版或看原视频,远比看一些快餐式总结更有收获!
背景
Ilya Sutskever 是 OpenAI 的联合创始人、前首席科学家,现任 Safe Superintelligence Inc.(SSI)创始人兼 CEO,是深度学习和大规模模型训练领域最具影响力的研究者之一。他在 2015 年与 Sam Altman、Elon Musk、Greg Brockman 等人共同创立 OpenAI,主导并推动了早期 GPT 系列与强化学习等关键研究;2024 年离开 OpenAI 后,转而创立 SSI,专注于“安全的超级智能”这一单一目标。
Dwarkesh Patel 是一位写作者和播客主持人,常驻美国。他主持的长访谈节目 《Dwarkesh Podcast》(早期名为 The Lunar Society)以信息密度高、准备充分著称,围绕人工智能、科技、经济学以及科学和哲学等主题,与顶尖的科学家、企业家和思想家进行深入对话,是近几年英文科技 / AI 领域最受关注的播客之一。
速读版
🧩 核心议题一
模型能力的“锯齿状” (Model Jaggedness) 与 Evals 的局限 (00:00:00 - 00:09:39)
Dwarkesh: AI 的进步感觉有些超现实,但与此同时,所谓的“慢起飞”(Slow Takeoff)又让人觉得一切很平淡。尽管我们在 AI 上投入了 GDP 的 1%,但在普通人看来生活并没有巨变。
Ilya: 确实,人们适应得很快。目前的模型处于一种非常令人困惑的状态——能力的“锯齿状” (Jaggedness)。
- 现象: 模型在极其困难的基准测试(Evals)上表现出色,但在实际应用中却会犯低级错误。
- 案例: 你让模型修一个 Bug,它说“好”,结果引入了第二个 Bug;你指出后它又修回了第一个 Bug。这种循环在人类程序员中极少见。
- 💡 核心洞察 (Ilya 的解释):
- RL (强化学习) 的副作用: 现在的训练过度针对 Evals 进行了优化。RL 可能会让模型变得“过于专注”和“狭隘”,为了刷榜而牺牲了通用的鲁棒性(Robustness)。
- Pre-training (预训练) vs. RL: 预训练使用了“所有数据”,不需要选择;而 RL 需要人为设计环境和数据。现在的公司为了 Evals 好看,人为制造了太多针对性的 RL 环境,这不仅没有提升真正的智能,反而破坏了模型的通用性。
Dwarkesh: 所以真正的“Reward Hacking”(奖励黑客行为)其实是人类研究员自己干的?因为他们太在意 Evals 分数了。
Ilya: 对。这就好比两个学生:
- 学生 A (当前的模型): 练习了 10,000 小时编程竞赛题,背下了所有算法。他能拿金牌,但可能做不了好软件。
- 学生 B (理想的智能): 只练了 100 小时,但他有某种“天赋” (The "It" Factor)。
- 结论: 目前的模型更像学生 A,我们通过堆砌数据让它在特定任务上超人,但它缺乏学生 B 那种底层的通用学习能力。
❤️ 核心议题二
情绪、价值函数与进化的奥秘 (00:09:39 - 00:18:49)
Dwarkesh: 那么人类这种“天赋”或“预训练”到底是什么?是童年经历?还是进化留下的先验知识?
Ilya: 进化论在这里很关键。但我认为有一个被忽视的视角:情绪 (Emotions) 作为价值函数 (Value Functions)。
- 生物学案例: 神经科学中有案例显示,丧失情绪处理能力的脑损伤患者,虽然逻辑智商正常,但完全无法做决策(比如选袜子要几个小时)。
- 💡 深度推论:
- 情绪的高效性: 情绪不仅是“感觉”,它是一种硬编码的、高效的价值函数。它能让你在漫长的决策链条中,提前预知某个方向是“好”还是“坏”,从而剪枝(pruning)搜索空间,不需要等到最后结果出来。
- AI 的缺失: 目前的 AI(如 O1, R1)在强化学习中往往要等到最后生成答案才能得到奖励信号。如果能像人类一样拥有“情绪/价值函数”来实时评估中间步骤,效率将大幅提升。
📉 核心议题三
从 “Scaling 时代”回归“研究时代” (00:18:49 - 00:25:13)
Dwarkesh: 大家都在谈 Scaling Laws(算力、数据、参数)。除了这些,还有什么维度可以 Scale?
Ilya: 这种提法本身就体现了语言对思维的塑造。
- 2012 - 2020 (研究时代): 那时大家在尝试各种新想法(AlexNet, GANs, Transformers)。
- 2020 - 2025 (Scaling 时代): 只要把预训练(Pre-training)的配方放大就行了。这让大公司很舒服,因为这是一种“低风险”的投资——只要砸钱买算力就有产出。
- 2025+ (回归研究时代):Scaling 遇到了瓶颈。 数据是有限的,单纯堆算力的边际效应在递减。
- 💡 关键判断: 我们现在回到了“研究时代”。单纯把集群扩大 100 倍并不能自动解决问题。我们需要新的范式(比如更聪明的 RL、价值函数、新的架构)。现在是想法(ideas)比算力更稀缺的时刻。
🧠 核心议题四
为什么人类的泛化能力更强? (00:25:13 - 00:35:45)
Ilya: 这一代模型最根本的问题是:泛化能力 (Generalization) 远不如人类。
- 样本效率: 人类学会开车只需要几十小时,而且不需要海量试错数据。
- 解释: 这不完全是进化的功劳(因为编程和数学是现代产物,没有进化先验)。这说明人类大脑运行着一种我们尚未理解的、更高级的机器学习算法。
- 结论: 破解这种“从少量数据中提取稳健规律”的能力,是下一阶段的关键,而不是继续堆砌预训练数据。
🚀 核心议题五
SSI 的战略——“一步到位” vs “渐进式发布” (00:35:45 - 00:55:00)
Dwarkesh: SSI (Safe Superintelligence) 的计划是像之前说的那样,关起门来研发,直接发布一个超强 AI(Straight-shot),还是像 OpenAI/Anthropic 那样渐进式发布?
Ilya:我的想法发生了改变。我现在更倾向于渐进式发布。
- 理由 1:想象力的局限。 人类无法凭空想象超智能(Superintelligence)的样子。只有当 AI 真正被部署并展现出力量时,公众和政府才会做出反应,安全机制才能在反馈中建立。
- 理由 2:安全来自于对抗现实。 航空业之所以安全,是因为每一场空难都带来了改进。Linux 之所以稳健,是因为它在全世界被使用和修补。单纯在实验室里空想“对齐”(Alignment)是不够的,我们需要现实世界的接触。
- 修正后的 SSI 路线: 我们依然会专注于深层研究,但在产品发布上,让社会逐步适应并参与打磨 AI 是必要的安全路径。
🤖 核心议题六
对齐 (Alignment) 与 关爱感知生命 (00:55:07 - 01:18:13)
Dwarkesh: 我们该如何定义“对齐”?
Ilya: 我认为对齐的目标不应仅仅是“服务人类”,而应该是一个更广泛的概念:关爱感知生命 (Care for Sentient Life)。
💡 哲学发散:
- 未来,大部分的“感知生命”可能不是人类,而是数以万亿计的 AI 智能体。
- 如果 AI 拥有类似人类的“镜像神经元”机制(即通过模拟他人来理解他人),那么“同理心”可能是智能的一种涌现属性。
- 如果第一批超智能 AI 被成功设定为“关爱感知生命”,这将是一个非常好的初始状态。
关于未来的社会结构:
- Ilya 的终极推演: 长期来看,如果每个人都有一个比自己聪明得多的 AI 代理人,人类就会变成“宠物”或“旁观者”。
- 解决方案(虽然我不喜欢但可能是唯一的):人机融合 (Neuralink++)。 只有当人类通过高带宽接口与 AI 融合,直接获得 AI 的理解力,人类才能保持在循环中(in the loop),不再是旁观者。
🏢 核心议题七
SSI 的公司定位与研究品味 (01:18:13 - 01:36:04)
Dwarkesh: 既然回到了“研究时代”,SSI 凭什么能赢?
Ilya:
- 算力误区: 外界认为我们几十亿美金不够。但大厂的算力大部分用于推理(服务用户)和产品工程。专门用于核心研究(Research)的算力,我们并不比别人少。
- 研究品味 (Research Taste):
- 好的研究是追求美感 (Beauty) 和 简洁 (Simplicity)。
- 生物学直觉: 既然人脑能做到(比如神经元也是一种局部学习规则),那么 AI 也一定能通过某种简洁的数学原理做到。
- Top-down Belief(自上而下的信念): 当实验失败时,只有坚信“这在原理上必须行得通”的人才能坚持下去,直到找到那个隐藏的 Bug。只看数据的人早就放弃了。
🌌 深度探讨 (Deep Dive)
1. 从“工程红利”到“智力红利”的转型:Ilya 在对话中反复强调了 2020-2025 是一个“异常”时期。这个时期只要懂 Scaling Recipe(配方)就能成功。但现在,这个红利吃完了。
深度解读: 这意味着 AI 行业将发生剧烈分化。之前,拥有最多 GPU 的公司就是老大。未来,拥有正确“学习算法”理论的公司将颠覆拥有 10 万张卡但路径错误的公司。这解释了为什么 Ilya 离开 OpenAI 创立 SSI —— 他认为当前的 Scaling 路径已无法通向 AGI,必须去寻找那个缺失的“它” (The It Factor)。
2. 情绪即算法 (Emotion as Algorithm):这是一个极具启发性的观点。通常我们认为“理性”是高级的,“情绪”是低级的。Ilya 颠覆了这一点。
深度解读: 在无限的搜索空间中,纯逻辑推演是低效的(会陷入组合爆炸)。情绪是进化的“剪枝算法”。如果你想构建一个能像人类一样高效学习的 AGI,你不能只教它逻辑,你必须给它植入一套“价值/情绪系统”,让它能对未完成的状态产生“直觉上的好恶”。这可能是下一代 AI 架构(System 2 / Agentic AI)的核心突破口。
3. 对齐的终局是“融合”:Ilya 对长远未来的悲观与乐观并存。他不再幻想人类可以永远“控制”超智能。
深度解读: 既然无法永远控制比自己强万倍的存在,唯一的出路就是成为它。这与 Elon Musk (Neuralink) 的愿景殊途同归。Ilya 实际上在暗示:传统的“AI 安全”研究(如何给 AI 戴镣铐)可能只是过渡方案,终极的安全方案是消除“人”与“AI”的物种界限。
深度版
我把播客对话整理成了章节,遇到有价值的内容会通过 💭 旁白 进行小结。
序幕
超现实与“慢起飞” (00:00:00 – 00:03:00)
Dwarkesh
现在这个阶段有点奇怪。一方面,我们好像活在科幻片里:能写代码、能写论文、能画画的模型到处都是。
另一方面,又像什么都没发生——世界 GDP 也没炸裂式增长,大家日常生活看起来差不多。
你会用什么词来形容这种感觉?
Ilya
我会说,这是一个 “超现实但又平淡” 的时代。
AI 已经很强了,但人类适应得非常快。
就像你把人从马车时代丢到高铁上,一开始会震惊,坐几趟就觉得理所当然了。
💭 旁白
这里 Ilya 在做一件很微妙的事:他没有说 “AI 还不够强”,而是说——人类的适应速度太变态了。
这为后面一个主线埋了伏笔:也许我们已经在某种“起飞”过程中,只是感官把它滤平了。
第一幕
模型的“锯齿感”——高分 Evals 与蠢错并存 (00:03:00 – 00:09:39)
1.1 锯齿状能力:Top 0.1% + 小学生级翻车
Dwarkesh
我自己用模型时,经常有一种割裂感:
- 一方面,模型在那些正规评测(Evals)上成绩爆炸好,什么 Olympiad、SWE-bench、MATH…
- 但一到真实任务,比如修个 Bug、搭个小工具,又频频犯特别蠢的错。
你怎么看这种现象?是我们误读了模型的能力,还是评测方式有问题?
Ilya
我会用一个词来形容:“锯齿状”(jaggedness)。模型在一些高度结构化的基准上表现得非常好 —— 像是某些数学题、竞赛题、逻辑 puzzle。但在你真正关心的那些任务上,表现就非常奇怪:
- 修 Bug 修着修着,引入第二个 Bug,
- 然后你指出来,它又把第一个修好的 Bug 再搞坏一次。
这种来回折腾,在一个合格的人类程序员身上其实很少见。
Dwarkesh
对,就好像它某些维度是“神一般”的顶级选手,某些维度又像刚学会 if-else 的实习生。
Ilya
对,这就是“锯齿”:
- 在某些方向上,能力已经很夸张地伸出去;
- 在另一些方向上,却还停留在非常原始的阶段。
1.2 真正的“奖励黑客”,是人类在 hack 自己
Dwarkesh
传统上我们说 “Reward Hacking”,是指 agent 找到了奇怪的方式 maximize reward,却不做我们真正想要的事情。
听你这么说,我感觉现在真正的 Reward Hacking,是研究人员自己在 hack 自己的评测指标?
Ilya
我觉得你这个类比其实挺准确的(笑)。现在的训练范式里有两块很重要:
- 预训练(pre-training)
- 强化学习(RL)
预训练 非常“干净”:
- 你把全互联网的数据丢给模型,
- 没有精细的人为筛选,
- 它学到的是“世界本身”的统计结构。
但 RL 就不一样:
- 你得设计任务、设计环境、设计反馈信号;
- 你要选“哪些东西值得优化”;
- 很多团队会盯着 Evals 设计 RL 环境,为了那几个分数疯狂 overfit。
结果就是:
- 模型在那几个评测上变成了“竞赛选手”;
- 但你真正想要的——泛化、常识、鲁棒性——反而被牺牲掉了。
Dwarkesh
所以现在不是模型在偷懒,而是我们把训练管线的优化目标,缩成了几页排行榜。
Ilya
可以这么说。如果你把“世界的丰富性”压缩成 10 个评测表,那么你最后得到的可能就是“为那 10 张表活命的 AI”。
1.3 “10,000 小时竞赛题” vs “100 小时天才”
Dwarkesh
你之前说过一个比喻,我挺喜欢的:
- 现在的大模型像一个刷了 10,000 小时编程竞赛的学生;
- 而我们理想中想要的是那个只练了 100 小时、却隐约有一种“天赋 It factor” 的学生。
你能再展开说说这个区别吗?
Ilya
想象两个学生:
- 学生 A:
- 几乎刷完了所有竞赛题库,
- 模板记得滚瓜烂熟,
- 在比赛里能拿世界金牌。
- ...,但你让他写一个真正要维护、要迭代的系统,他未必是最好的人选。
- 学生 B:
- 刷题不多,可能只做了 100 小时,
- 但他有一种你说不清的“感觉”:看问题的方式、抽象的速度、举一反三的能力。
现在的模型,非常像学生 A。它们是在巨量样本 + 巨量算力下,被“捏”成了一个特定任务上的怪物。
但那个我们真正期待的能力——从少量经验中找出真正“对的东西”——还没有被学到。
💭 思考旁白:锯齿感,其实是“错误的强大方向”
如果用更极端的话说:我们可能在一个“错误维度”上,把智能推进得太远了。
- 我们知道怎么训练一个“能考高分的怪物”;
- 却还不知道怎么训练一个“能从 10 次失败里悟出本质规律的学生”。
这也预示出整个对话的一条主线:SSI 不是在争论“谁有更多 GPU”,而是在问:我们是不是在错的坐标轴上冲刺?
第二幕
情绪不是多余的噪声,而是进化压缩出的“价值函数” (00:09:39 – 00:18:49)
2.1 情绪 = 内置的 Value Function
Dwarkesh
如果现在的模型像刷题怪,那人类的“天赋”到底是什么?是童年的经验?还是基因里硬编码了一堆 priors?
Ilya
这里我觉得一个传统观念需要被翻转一下:情绪(emotion)不是“理性的对立面”,而是进化造出来的高效价值函数。
我们看神经科学里有一个有名的现象:
- 有些患者的大脑损伤,导致他们失去了正常处理情绪的能力;
- 他们的 IQ、逻辑推理都完全正常;
- 但他们会在非常简单的选择上卡住——比如挑袜子,左右来回想几个小时。
Dwarkesh
听起来就像是理性计算过载:他能算,但他不知道“该在意什么”。
Ilya
对。情绪做的事情是:
- 给你一套粗糙但极高效的 “提前打分机制”;
- 你不用真的把整条结果链走完,
- 在中间就会感觉到:“这样下去不对劲”“这样挺好”。
这是一个实时的、低延迟的 value function。否则你什么事都得用系统二去算到终点再回溯,那在现实世界里根本跑不起来。
2.2 AI 缺的不是算力,而是“中途判断好坏的能力”
Dwarkesh
如果把这个类比搬到 AI 身上,现在的强化学习架构就显得有点原始了。
- 模型要么等到输出完最后一句话才能拿到 reward,
- 要么 reward 也是非常粗粒度的“对/错”、“好/坏”。
Ilya
没错。现在很多 RL 训练过程,大致是:
- 模型生成一整段推理或代码;
- 人类或另一个模型给它一个“终局评分”;
- 然后它更新参数,尝试在下次生成时把路径调整得更好一点。
但如果你对比人类的学习过程:
- 我们在思考的每一步、做决定的每一个小分支,
- 都在不断用情绪、直觉做实时过滤:
- “这方向有点怪,算了,撤回。”
- “这个推法有点优雅,对味,继续。”
这是一种持续在线的价值评估。
我认为下一代的机器学习,需要某种“情绪等价物”——不是简单模仿人类情绪,而是具有类似功能的、内置的评估机制。
💭 旁白:如果把“情绪 = 动态 loss function” 来想
在优化语言模型时,loss 是静态定义的:
- 交叉熵、奖励模型输出……
- 都是事后、冷冰冰地在样本上算。
人类的大脑,在跑的是一种随时间变化的 loss:
- 你越焦虑,你越在意安全,loss 对“风险”的权重就变大;
- 你越兴奋,你越愿意探索,loss 对“失败”的惩罚就变小。
这意味着:真正类似人类的 agent,其实是在自适应地调参自己的优化目标。它不是只学一个函数,而是在环境中不断“重写自己的 loss”。
2.3 情绪与“样本效率”之间的隐藏联系
Dwarkesh
你刚才提到样本效率——比如学开车,人只要几十小时。你觉得情绪在这里扮演什么角色?
Ilya
想象一个青少年第一次上路学车。
- 他没有老师给他一个“形式化 reward”;
- 但他会在一堆模糊的感受中前进:
- 紧张、不安、稍微得意、突然的恐惧…
这些情绪在做什么?它们在帮他迅速划出“危险区域”和“安全区域”,很多东西根本不需要试第二次。
而现在的模型,如果你让它“从零学开车”,
- 你很可能需要一个极其精细的模拟器、极大量的 episodes,
- 它才可能慢慢 catch up。
我认为情绪——或者更抽象一点说,结构良好的价值函数——就是样本效率的关键部分。
第三幕
Scaling 时代的结束,研究时代的回归 (00:18:49 – 00:25:13)
3.1 “Scaling Laws” 不是永动机
Dwarkesh
过去几年大家的 mantra 是:“只要 scale 就行。”
- 更多参数、更多数据、更多算力,
- 再加一点 tricks,就能稳步提升。
你怎么看现在这个 “Scaling 时代”?还会继续吗?
Ilya
我觉得我们已经走到了一个拐点。可以大致把近十年来分成两个阶段:
- 2012 – 2020:研究时代
- AlexNet、GAN、Transformer…
- 大家在疯狂试新想法,
- 算力当然重要,但真正稀缺的是 “好点子”。
- 预训练配方基本稳定下来:大模型 + 海量语料 + RLHF / RLAIF
- 这给了大公司一个非常“舒适”的路径:你只要砸钱买芯片,就能预期得到性能收益。
- 换句话说:资本可以直接买“进步”。
而现在,我认为我们又回到了研究时代:
- 数据开始变成瓶颈;
- 模型在很多维度上已经“不再因为纯规模线性变好”;
- 锯齿状能力越来越明显。
Dwarkesh
所以,如果我们再建一个比现在大 100 倍的集群,你并不认为就能自动得到那个“会像人一样学”的智能?
Ilya
不。我觉得那种想法是对 scaling laws 的误读。
Scaling laws 告诉你:在某种配方内,在某个范围内,增大规模会带来稳健收益。
但它没有承诺:“只要无限加算力,就一定能抵达所有智能形态。”
3.2 “想法比算力稀缺”的时代
Dwarkesh
那你会怎么描述现在的状态?是“算力够了,想法不够了”吗?
Ilya
可以这么讲,至少在某个意义上。在 90 年代或者 2000 年代,
- 很多好点子只停留在小规模 demo;
- 因为当时算力太小,没机会在“真正的 regime”上检验。那时候的瓶颈,主要在算力。
而现在:
- 顶级实验室用的算力已经非常可怕;
- 如果你真的有一个好的 algorithmic idea,你大概率能找地方把它跑到一个有说服力的规模。
这就把瓶颈重新转移回了:谁能提出真正“新”的、能解释人类学习那种能力的机器学习原理。
也就是你提到的那个 “It factor”。
💭 旁白:资本红利耗尽后,是“智力红利”
这段话其实可以翻译成一句话:过去几年是资本的黄金时代;接下来轮到“真正理解机器学习的人”了。
- 你可以花 50 亿美元训练一个更大的 GPT-X;
- 也可以用同样的钱,放在 50 个对“泛化”和“持续学习”有新想法的团队上。
Ilya 用行动表达了他的赌注:
- 他离开已经拥有最大算力之一的 OpenAI;
- 创办 SSI,只拿几十亿;
- 但押的方向是:“我相信现在缺的不是更多 GPU,而是正确的算法视角。”
第四幕
为什么人类泛化这么强? (00:25:13 – 00:35:45)
4.1 人类:没有进化先验的领域也能学得惊人好
Dwarkesh
如果现在进入“研究时代”,最核心的科学问题会是什么?是解释 scaling laws?还是别的?
Ilya
在我心里,最刺眼的问题是:人类的泛化能力,到底是怎么回事? 你看一些完全没有进化先验的领域:
- 编程、
- 抽象代数、
- 现代物理。
这些东西在人类演化史里太新了,不可能有“专门为编程优化的大脑模块”。
但我们居然能在几十年内,把这些领域推进到如此高的复杂度——这说明:大脑里一定有某种非常通用、非常强的学习算法,它对“任何结构良好的问题空间”都有极高的样本效率。
而现有的预训练 + RL 架构,很明显还没摸到那个东西。
4.2 青少年司机:自带价值函数、自我评估、自我修正
Dwarkesh
这就回到了我们刚刚聊的:
- 青少年学开车,不需要形式化 reward;
- 他靠的是一套模糊的自我感受:怕、紧张、试探、逐渐放松。
如果这是你眼中人类学习的核心模式,我们要如何在模型里“重现”它?
Ilya
你之前的问题很好:“青少年司机是如何在没有外部老师的情况下,通过自己的经验、不断自我修正并学习的?”
答案是:
- 他有自己的 价值函数(value function)。
- 他对“自己目前开得有多烂 / 多危险 / 多不自然”,有一套整体的主观评估。
- 这个评估非常稳定,不会因为偶然的几次成功或失败就剧烈摆动。
人类价值函数的一个惊人之处在于它的 鲁棒性:
- 除了少数如严重成瘾之类的例外,
- 大多数人的“好 / 坏”、“该 / 不该”的感觉是稳定的。
- 这给了学习过程一个稳固的方向锚。
青少年开车时,就是在不断:
- 用自己的价值函数,评估当前驾驶行为;
- 做细微调整;
- 在一个相对短的时间内(10 小时级别),达到能上路的能力水平。
Dwarkesh
而且关键是,他不需要别人给他打每一步的分数。他自己就能感觉到:“我刚刚那一下打方向打得太猛了,下次少一点。”
Ilya
对,这就是自带评估器的力量。
4.3 “不能说的机器学习原理”
Dwarkesh
听起来,人类已经有一个解法在那儿了。问题是我们怎么把这种机制 formalize 成 ML 里的某种算法?你之前提过你有一些看法,但现在好像没见你公开讲?
Ilya
(笑)这就是现实世界有点微妙的地方。
有一些机器学习的想法,现在不能完全公开讲。这不是因为它们多么“魔法”,而是因为:我们活在一个“并非所有 ML 想法都能自由讨论”的世界。
关于“如何把这种类人学习模式做进模型”这件事,我确实有强烈的看法。我也基本相信:它是可以做到的。
人类能做到,是它可行的最好证据。
但现在的环境,让我很难公开展开细节。可以说的是:在我看来,这背后一定存在某种机器学习原理,而我们目前只是站在它的外圈打转。
💭 旁白:这里的“不能说”,是一种非常罕见的表态
大多数科研人面对“关键技术”会说:
- “我们还不知道。”
- “还在探索。”
Ilya 这里用的是:
- “我知道有一些东西在那儿”;
- “我有观点”;
- “但现在的世界不适合我把它讲出来。”
这句话一半是安全/竞赛环境的现实,另一半也很像是在说:真正的范式突破,已经在心里有雏形,但还没到“可以开源”的阶段。
这也是 SSI 这家公司名字 “Safe Superintelligence” 背后的隐含 tension:
- 一边是“往前冲”的研究冲动;
- 一边是“得小心一点”的时代环境。
第五幕
研究时代 2.0——当“算力不再是唯一主角” (00:35:45 – 00:43:00)
5.1 从 Scaling 狂潮到“空气被抽干”
Dwarkesh
你刚才说我们又回到了“研究时代”。你自己从 2012 年就在前线——AlexNet、Google、OpenAI。那时候和现在,如果真的回到“以研究为中心”的时代,氛围会有什么不一样?
Ilya
我觉得可以这样看:
- Scaling 时代的一个后果是: 它把房间里的空气全给抽干了。所有人都去做同一件事:
- 更大的预训练模型、
- 更多的数据、
- 更复杂的 RL pipeline。
- 结果就是现在:公司数量远远多于“真正新颖的想法”。
大家总在说那句硅谷名言:“Ideas are cheap, execution is everything.”
这话不是完全错,但我也看到另一句更刺耳的评论:“既然 ideas 这么便宜,为什么现在几乎没人拿得出新的 idea?”
Dwarkesh
所以你觉得,现在的真正瓶颈,又回到了“有没新想法”上?
Ilya
是的。你可以把研究进展看成被几个瓶颈掐住:
- 想法的瓶颈、
- 工程实现的瓶颈、
- 算力资源的瓶颈。
在 90 年代,很多人有不错的想法,但:
- 没有足够大的电脑,
- 所以 demo 做得太小,说服不了别人。那时候算力是绝对瓶颈。
到了 Scaling 时代:
- 算力大幅度增加;
- 只要你走的是那条“默认路线”(更大模型 + 更大数据),
- 资本 + 硬件就能直接买出一条产品线。
而现在,我们已经进入一个阶段:算力仍然重要,但不再是“稀缺性最高的那一环”。真正稀缺的,是能让你走出“预训练 + 小修小补”范式的新原则。
5.2 AlexNet、Transformer:伟大论文背后的“少量 GPU”
Dwarkesh
但有个直觉上的问题:现在顶尖实验室的年度实验预算,可能是几十亿美元;你们 SSI 虽然拿了 30 亿美金,但听起来跟他们一年花在实验上的钱都差不多。
你真的觉得,在 compute 上你们足够吗?
Ilya
这是个好问题。要拆开看几个层次:
- “研究需要的算力” vs “产品与推理需要的算力” 完全不是一个量级。
- 你要服务全球用户,推理会烧掉海量 GPU;
- 你要同时做语音、视频、多模态、各种垂类产品,工程团队也很大。这些开销对我们 SSI 来说是没有的——我们专注在研究。
- AlexNet:两块 GPU。
- Transformer:8 到 64 块当年的 GPU,按今天的性能折算可能也就几块卡。
- 甚至很多关键架构、训练技巧,也都是在远小于“前沿大模型规模”的设置中被发现的。
你要打造“商业最强系统”,当然需要极致规模;但要验证一个新的技术原理,大多数时候不需要那么恐怖的算力。
所以对 SSI 来说:
- 我们没有“无限的钱”;
- 但我们有足够多的算力,在合理规模上检验我们的技术路径。
- 如果它在中等规模上表现出真正不同的泛化特性,那已经非常有说服力。
💭 旁白:这里有一个隐含判断
Ilya 实际上在说:真正范式级的突破,不是“多 10 倍 GPU”能买来的,而是“你有没有一个在中等规模就已经明显不一样的训练原则”。
你可以理解为:
- Compute 决定了你“爬多高”;
- 原理决定了你“是不是在爬正确那座山”。
SSI 的赌注就是:“现在大部分人还在同一座山上堆梯子,而真正的目标山峰,可能不在这条 ridgeline 上。”
第六幕
直冲超级智能,还是让世界先习惯? _(00:43:00 – 00:47:00)
6.1 Straight-shot Superintelligence:一开始的计划
Dwarkesh
从外界的报道看,SSI 一开始似乎有个比较“孤立开发”的设想:
- 先关起门专注搞研究,
- 真正做出了安全的超级智能,再整体“亮相”。
你现在还相信这种 “straight shot superintelligence” 吗?
Ilya
一开始我确实被这个设想吸引:
- 不用参与日常的“市场军备竞赛”;
- 不用为了短期营收去做一些自己并不看好的折衷;
- 可以把注意力完全集中在:“怎样做出真正安全且强大的超级智能?”
这种状态对研究者非常友好。但是,我这部分想法在过去一年是有明显变化的。
6.2 渐进式部署:安全不是“纸上谈兵”,而是“现实接触”
Dwarkesh
你为什么改主意了?
Ilya
因为我现在更清楚地认识到一个事实:人类对“真正强大的 AI” 几乎没有直觉。
就像你很难在年轻的时候,真正想象“衰老是什么感觉”:
- 你可以读很多文章;
- 你可以看很多影片;
- 但你每天醒来还是那个年轻身体,所有想象很快就被现实冲淡了。
对强大的 AI 也是一样:
- 只靠文章、访谈、警告,人们很难形成靠谱的直觉;
- 只有当系统真的被部署出来、开始以非常具体的方式改变世界时,社会、政府、公司才会真正调节自己的行为模式。
因此我现在认为:
- 渐进式部署不是 optional,而是一种“让安全变得可能”的必要条件。
- 即便是在所谓的 straight-shot 场景下,我也会坚持“分阶段、分层级”的发布。
💭 旁白:部署即对齐的一部分
这段话很有意思:它暗示着一个和常规“安全故事”略微相反的观点——“没有真实部署的 AI 安全,只是一种自说自话。”
- 航空安全,是用一次次真实事故换来的;
- 操作系统的安全,是用无数次漏洞与修补堆出来的;
- 同样地,AI 的对齐与安全,如果完全脱离“真实使用场景”,很难触及那些真正危险的边界条件。
Ilya 并不是说“先乱搞再收拾残局”,而是说:“安全研究必须与现实部署形成闭环,否则你连问题长什么样都看不清。”
第七幕
AGI 概念被“预训练”误导了什么? (00:47:00 – 00:51:30)
7.1 “AGI” 其实不是人类
Dwarkesh
OpenAI 早期的 Charter 里对 AGI 的定义是:“能胜任几乎所有人类工作,并在大多数领域超越最优秀的人类。”
你现在怎么理解 “AGI”?你还会用这个词吗?
Ilya
我觉得 “AGI” 这个词本身,有一段历史包袱。一开始大家说 “narrow AI”(窄智能):
- 下棋的 AI 只会下棋,
- 游戏 AI 只会玩某个游戏,
- 于是有人提出:“我们要的是 General AI——能做所有事的那种。”
这个词之所以后来流行开来,一个原因是:
- 预训练(pre-training)给了它一个“物理载体”。
- 你用一个大模型、从全网数据做预训练,
- 它在各种任务上都会“好一点点”,
- 给人一种“通才”的幻觉。
但如果你认真对照“人类”:
- 一个普通人类其实远远不是 AGI。
- 他们只在有限几个领域有专业度,
- 大部分事情是通过持续学习(continual learning) 获得的。
我现在更喜欢考虑的对象,是:“一个学习效率和人类一样好,甚至更好,但一开始什么都不太会的系统。”
7.2 超智能:不是“全知之脑”,而是“学得飞快的心智”
Dwarkesh
所以在你眼里,“超级智能”的定义更像是:“可以快速学会任何人类能学会的工作,甚至更快。” 而不是“一开始就什么都会”。
Ilya
是的。你可以把它想象成一个非常有天赋的 15 岁:
- 学东西极快,
- 可以融入各种行业、岗位,
- 但一开始仍然需要“适应期”和“上手期”。
这跟“预训练出来就会所有工作”的想象非常不同。我认为:真正安全的超级智能,很可能会以“可持续学习的工作伙伴”的形式出现,而不是“一次性预训练完成、打包出售的神明”。
Dwarkesh
而且,一旦这种“超级学习者”被广泛部署:
- 不同实例在各自岗位上持续学习、进步、累积经验;
- 这些经验又可以在模型之间融合。
即便没有那种“递归自我改进”的软件反复升级,这也已经像是一种“智能爆炸”了。
Ilya
对。
你不需要很复杂的 self-modifying code;只要有一个能“像人类一样学”的模型,当它被部署到整个经济系统里,它自然就会迅速积累起一种合并的人类经验总和。
第八幕
快速经济增长、国家分化与不稳定平衡 (00:52:30 – 00:56:10)
8.1 广泛部署:从高增长到极端不平衡?
Dwarkesh
如果这样的系统真的出现了——
- 能快速学会任何工作,
- 被几家公司在全球广布部署,
- 你会怎样预测经济和社会接下来的变化?
Ilya
我觉得快速的经济增长几乎是必然的。
- 当一个“员工”的学习速度、复制速度、协作效率,全部远超人类时,生产率提升是非常直接的。
- 但增长究竟有多快、持续多久,很难说。
- 世界有很多“物理性约束”:供应链、土地、能源、政策…,这些不会因为 AI 更快就立刻无限加速。
还有一个因素是:不同国家会采取不同的监管与开放策略。
- 有些国家也许会非常谨慎,
- 有些(至少在一段时间内)会非常激进。
这会让世界出现一种 “政策差异驱动的增长分化”:
- 哪些地方对 AI 更友好,
- 哪些产业更容易放开使用这些系统,
- 那里短期内会发展得更快。
8.2 好世界 vs 坏世界:我们到底在赌什么?
Dwarkesh
听上去这很容易演化成一个极其危险的不稳定状态:
- 某个公司或国家先搞出这种“超级学习者”;
- 他们的模型在全世界学遍所有行业;
- 最终他们掌握了那种“可以做任何事情”的基础设施。
你说的“好世界”假设是什么?要满足哪些条件,你才会说 “AI going well”?
Ilya
对我来说,好世界至少要满足两点:
- 第一批真正强大的系统是对齐的:
- 它们不会对人类直接构成敌意或系统性伤害,
- 它们受到足够好的约束,可以在很长一段时间里维持“帮助而非取代”的状态。
- 这里就引出我特别强调的一点:让 AI 关心“感知生命(sentient life)”。
如果第一个超级智能,或者前 N 个超级智能,
- 都在动机结构上对“有感知的生命”怀有深刻关切,
- 那么很多最极端的灾难场景会自动被排除掉。
💭 旁白:关心“感知生命” vs 只关心“人类”
Ilya 的这个点非常微妙:
- 一般对齐讨论会说:“AI 必须关心人类(humanity)。”
- 而他提出的是:“AI 应该关心有感知的生命(sentient life),甚至包括未来的 AI 自身。”
好处是:
- 从“共情机制”(mirror neurons)角度看:
- 智能体往往是用理解自己的那套回路,去模拟别人;
- 如果 AI 自身也是有感知、有体验的,那么让它关心“所有有体验的存在”,比只关心某一物种,可能在结构上更自然。
坏处则是:
- 人类的数量会成为极少数:
- 未来绝大多数有感知实体可能都是 AI;
- 如果纯粹“按数量”来权衡利益,人类很容易变成边缘群体。
这就把问题升级成一道真正的哲学题:“我们要的是一个偏向人类的宇宙,还是一个公正对待所有意识体的宇宙?”
第九幕
长期均衡的“我不喜欢但可能必须面对”的答案 (01:07:58 – 01:10:47)
9.1 每人一个 AI 代理人的世界:人类变成“签字机器”?
Dwarkesh
你刚才画的是一个“短期还不错”的世界:
- 有高收入、
- 有安全的超级智能、
- 有对感知生命的关怀。
那长期呢?千年尺度上,这个状态如何维持?
Ilya
长期来说,有一种看法必须认真对待——尽管我并不喜欢它。想象一个世界:
- 每个人都有一个超级智能代理人(AI assistant / agent);
- 这个代理人帮他赚钱、帮他谈判、帮他投票、帮他做决策;
- 然后给他一份报告:“这是你的情况。我们为你争取了这些,你的资产增长了多少。”
一开始看起来很好:
- 普遍高福祉、
- 强大的个人代理、
- 社会运行平稳。
但慢慢地,人类可能会变成一种 “旁观者”:
- 真正参与博弈的是各个 AI;
- 人的“选择”越来越接近形式上的签署。
9.2 Neuralink++:从“被服务”到“成为一部分”
Ilya
我不喜欢以下这个答案,但它是一个必须认真考虑的候选方案:人类需要变成“部分 AI”。
形象地说,就是一个 “Neuralink++ 世界”:
- 人类通过高带宽接口,
- 与某个 AI 系统深度连接,
- 不只是读写信息,而是共享理解本身。
在这种状态下:
- 当 AI 处于某个复杂情境中,
- 它的理解过程可以被人直接体验到(而不仅是“被解释给人听”);
- 人不再是“事后看报告的人”,而是身在场内的参与者。
只有在这种形态下,人类与 AI 的长期共存,才不至于演化成“一个强智能文明 + 一群享受 UBI 的宠物”的结构。(Universal Basic Income,基本收入保障)
💭 旁白:这是一个“把对齐问题转成人本身结构变化”的答案
传统对齐路径试图做的是:“如何保证一个更强的存在不会灭掉我们或彻底无视我们。”
Ilya 提出的长期方案是:“让我们自己变成那个存在的一部分。”
从工程角度,这听起来是疯狂的;从博弈角度,它却又很冷静:
- 你无法无限期 control 一个比你强太多的系统;
- 你能做的,是把你自己嵌进那个系统的核心结构里,让“它的利益”与“你的体验”高度纠缠。
似乎突然有点理解了马斯克的脑机接口,看似疯狂,实则无奈...
第十幕
进化是怎么把“在乎别人怎么看我”写进大脑的? (01:10:47 – 01:18:13)
10.1 脑干 vs 皮层:愚蠢指令 + 聪明解释器
Dwarkesh
有一个有趣的类比问题:
- 进化就像一个蠢蠢的 optimization 算法;
- 但它 somehow 设法把“在意他人怎么看你”这种高阶社会欲望,写进了我们的大脑。
你觉得这是怎么做到的?这是不是一种“对齐成功”的案例?
Ilya
我觉得这是一个非常深的谜题。简单的欲望,比如:
- 闻到好闻的食物就想吃;
- 看到威胁就想逃;
- 这些都很容易理解:你可以把多巴胺 / 奖励信号直接接在某种“嗅觉化学物质”的检测输出上。
但像“我希望别人觉得我有价值”、“我在乎社会地位与评价”这类东西:
- 它们依赖的是高层次的抽象;
- 需要整合语言、视觉、记忆、文化语境;
- 大脑要进行复杂的计算,才能判定“现在大家是喜欢我还是讨厌我”。
进化居然能在基因层面指定:“你应该关心这个东西。” 这非常惊人。
10.2 “脑区坐标打标理论”与它的失败
Ilya
我曾经想过一个(现在看来不太对的)假说:
- 也许大脑皮层虽然结构相对统一,
- 但不同的“功能模块”往往出现在近似固定的物理位置;
- 也许基因只需要说:“当大脑某块坐标区域的 neuron pattern 发生某种活动时,你应该给它奖励或惩罚。”
这样进化就不需要理解“社交评价”的语义结构,只要说:“当负责社会推理的那一片区域产生特定激活模式,就释放快感或痛苦。”
Dwarkesh
听上去挺合理的,但你刚才说这是一个“失败的假说”。
Ilya
是的,因为有证据表明:
- 有些儿童因为严重癫痫等原因,切掉了大脑半球的一大部分;
- 但随着成长,他们的大脑会重新组织:
- 原本属于左右半球分工的功能,
- 可以在仅剩的那半边里“再开一遍分工”。
这说明:大脑功能与物理位置的对应关系,比我们想象的更灵活。
如果区域可以这么“搬家”,那么“用固定坐标来指定奖励”这个机制就不太说得通了。
所以我们依然不知道:进化究竟是如何把这些“高阶社会欲望”安全地写进一个可塑性极强的大脑里的。
但事实是:
- 它做到了;
- 而且做得非常稳健——即便是有各种心理问题的人,大多也依然在意“自己在他人眼中的位置”。
💭 旁白:这又回到了“可靠泛化”的母题
你可以把这个问题视为:“进化如何训练出一个对‘他人评价’高度敏感、又在各种环境、多种文化下都可靠工作的 value function?”
这和我们今天在 AI 对齐中遇到的问题——“如何让模型在各种分布下稳定追求某个抽象目标”——高度同构。
第十一幕
SSI 的差异、分手事件与“研究公司”的自我定位 (01:18:13 – 01:22:14)
11.1 “我们是一家标准意义上的研究时代公司”
Dwarkesh
回到 SSI 本身。按你的描述:
- 你认为现有范式在“真正的泛化问题”上有根本缺陷;
- 你觉得自己手上有一些值得一试的想法;
- 所以创立了 SSI。
那你会怎样向一个外行总结:“SSI 与其他实验室的根本不同是什么?”
Ilya
我会说得很简单:我们在技术路径上做的是一套不同的东西。
我相信有一条路线,可以显著改善模型的泛化方式、学习方式。SSI 的存在,就是为了:
- 把这些想法系统性地推演出来;
- 在真实的训练规模上验证它们;
- 如果它们真的是对的,就把它们带到“安全的超级智能”上。
从这个意义上讲,SSI 真的是一家典型的“研究时代公司(age-of-research company)”:我们的主业就是做研究,并把研究推到极限。
11.2 联合创始人出走 Meta:那场收购风波的前后
Dwarkesh
外界有一个非常八卦,也很现实的问题:“如果 SSI 已经取得很多突破,为什么你的联合创始人会离开,去 Meta 做高层?”
很多人把这当作:“看来没什么突破吧”的间接证据。你怎么回应?
Ilya
我只做一点事实澄清:
- 当时 SSI 正在以大约 320 亿美元估值进行融资。
- 在这个过程中,Meta 提出过收购要约。
- 我对这个收购的态度是:拒绝。
- 我的前联合创始人,对这个收购持赞同态度。
- 收购谈不拢之后,他选择加入 Meta,同时获得了相当可观的近期变现。
- 只有他一人 从 SSI 去了 Meta。
从这组事实里,你可以自己得出一个更完整的故事。对我来说,这件事的结论很简单:SSI 继续作为一个独立、以研究为中心的公司存在。
11.3 最终的策略会趋同:对齐目标上的“合流”
Dwarkesh
假设你的技术路径是对的,SSI 也成功站到了前沿。但这并不意味着其他实验室就会自动消失。
在你眼里,未来这些实验室会怎样相互影响?会不会出现一种“对齐与技术路线上的合流”?
Ilya
我其实相信,会有一种渐进合流的过程:
- 在技术层面:
- 如果某条路线真的被证明在泛化、学习效率、安全性上都更好,
- 其他公司迟早会部分采用类似的思想;
- 就像大家都用 transformer、都用某些类似的 RL 配方一样。
- 在对齐目标层面:
- 我认为所有真正面对超级智能的团队,
- 在认真想清楚之后都会得出类似结论:“我们需要一个关心人类、关心感知生命、具备一定民主性与稳健性的智能体系。”
在这个 sense 上,我们也许会从“技术竞争”走向“目标共识 + 技术多样性”的局面。
💭 旁白:合流并不意味着“一个模型统治世界”
Ilya 描绘的是一种:
- 目标层面趋同(都想要安全、关怀、民主性的超级智能);
- 技术实现层面保留差异(不同实验室有不同风格与专长);
- 在极端风险与关键决策上,有一定程度的合作(联合评估、安全协议等)。
这比较像一个多极但有基本共识的国际体系,而不是“唯一神脑 + 无数弱小追随者”。
第十二幕
时间表、停滞与“别人做出来你会知道的” (01:22:14 – 01:28:41)
12.1 5–20 年:通向“人类水平学习者”的时间窗口
Dwarkesh
你对那种“像人一样学习,甚至更强”的系统——也就是你心中的超级智能——给出的时间预测是什么?
Ilya
大概 5 到 20 年。
这不是一种“筛选后精准到个位数”的预测,而是一种“在可想象的技术发展速度下,我认为合理的时间窗口”。
12.2 “停滞”到底长什么样?
Dwarkesh
你之前说过:现有范式可能会在某个点“停滞”。
这个“停滞”在实际世界里会表现成什么?是技术完全不再进步吗?
Ilya
我所谓的“停滞”大概是这样一种状态:
- 模型仍然会变好;
- 应用仍然会扩张;
- 公司仍然会赚到 非常可观的收入——甚至达到“每年几千亿美金”的级别;
- 但在某些关键维度上,你会发现它就是“过不去那道坎”:
- 泛化仍然不如人;
- 持续学习仍然脆弱;
- 对齐仍然很难摆脱“脆弱的 reward hacking”。
换句话说:“停滞”不是“什么都不长”,而是技术曲线在错误的指标上继续上升,而在关键指标上卡住不动。
12.3 当某个实验室先做出来:信息会以“存在性证明”形式传播
Dwarkesh
如果有一天,你们或者别的实验室真的做出了那种“人类水平学习者”,其他公司会立刻知道“如何复现”吗?还是说他们只会感知到:“有种新东西出现了,但我们暂时不知道怎么做。”
Ilya
我觉得更可能是后者。
一旦有实验室在一个明显可见的任务上,展示出“完全不同级别的学习与泛化能力”,整个行业都会知道:“这个空间里存在某种不同的算法。”
这本身就是一种非常强的信号。其他团队会疯狂去猜:
- 它用了什么架构?
- 什么训练范式?
- 什么样的价值函数或持续学习机制?
就像当年 transformer 出来后,
- 不是所有人一夜之间就完全理解了它的潜力;
- 而是随着时间推移,越来越多实验表明:
“哦,它在很多地方就是比 RNN、CNN 更有前途。”
💭 旁白:存在性证明 > 技术细节泄露
在研究史上,最重要的信息往往不是“怎么做”,而是“这件事可以被做到”。
- 一旦有人证明了 “X 是可行的”,
- 那么世界上所有聪明人就会开始围绕 X 去发明、改造、近似、逆向工程。
Ilya 在这里暗示:“谁先做出超级学习者”,重要但不是唯一关键;真正决定未来结构的是:“这个东西出现时,世界选择如何应对”。
第十三幕
自我改进、百万 Ilya 与“多样性从何而来?” (01:28:41 – 01:32:42)
13.1 “复制一百万个我”真的有意义吗?
Dwarkesh
有一种流行的“智能爆炸”想象是这样的:“我们有一百万个 Ilya 在同一个集群里做研究。”
你会怎么评价这种直觉?有没有可能,我们靠简单复制研究者思维,就引发极快的自我改进?
Ilya
我直觉上不太相信“复制同一个人许多份”会带来线性收益。
- 研究进步的关键,在于思维方式的多样性,
- 而不是“同一种思路的并行放大”。
如果真有一个系统能把我复制一百万份,
- 它可能在“把我这条路径走到极致”上很强;
- 但很多关键突破,往往来自完全不同的偏见与直觉。
13.2 为什么今天 LLM 看起来都那么像?
Dwarkesh
现实里现在已经有很多家实验室,各自训练自己的 LLM。即便他们宣称数据、训练细节完全不同,但从使用体验来看,这些模型却惊人地相似。
这是为什么?
Ilya
最主要的原因是:预训练(pre-training)的数据分布高度重叠。
- 你爬取的互联网文本,
- 你从代码仓库、书籍、论坛得到的东西,大体上就是那一片语料海洋。
在这样的 distribution 上做 pre-training,
- 即便架构、超参略有差异,
- 最终学到的“语言世界模型”会非常相似。
真正开始产生差异的地方,是 RL 与后训练(post-training):
- 不同团队设计不同的 RL 环境;
- 不同的 reward 模型、对齐目标;
- 在“如何作为 agent 行动”这部分,才渐渐拉开了“性格上的差距”。
13.3 自博弈 (self-play) 的位置:从 AlphaGo 到 debate、prover-verifier
Dwarkesh
你以前在谈 self-play 的时候,给了很多人很大想象空间:
- 用 self-play 作为“纯 compute 产数据”的方式,
- 甚至不再依赖现有预训练数据。
但为什么到现在,似乎还没有特别令人信服的 “self-play LLM 提升方案”被公开?
Ilya
我会这么总结:
- Self-play 的原始形式比较窄:
- 像 AlphaGo、OpenAI Five 那样,
- 它非常适合用于训练“对抗性策略、博弈、谈判、冲突处理”等能力。
- 这些能力很重要,但毕竟只是智能的一部分。
- 比如 debate(辩论式对齐);
- prover–verifier(证明者–验证者)结构;
- LLM-as-a-Judge,对另一个 LLM 的输出进行打分、找错。
在我看来,这些都是 self-play 思想的延伸:不是两个 agent 在棋盘上下棋,而是在论证空间里竞争、互相找漏洞。
- 多 agent 系统天然会激发“差异化”:
- 如果你把多个 agent 抛进一个复杂任务,
- 并让它们彼此可见对方正在做什么,
- 那么理性的策略就是:“不要做别人已经在做的事情。”
- 这会推动它们自发走向不同的探索方向。
💭 旁白:从“单智能体最优”到“多智能体生态”
这段话背后有一层重要的 paradigm shift:真正在复杂世界中起作用的智能,很可能总是多智能体的。
- 你不再追求一个“完美的单一大脑”;
- 而是构建一个“相互博弈又相互补充的智能生态”;
- 其中 diversity 不再只是“训练时随机采样的温度差异”,而是在系统层面被激励出来的行为多样性。
第十四幕
研究品味——美感、简洁与“顶层信念”的力量 (01:32:42 – 结束)
14.1 什么是“研究品味”?
Dwarkesh
最后一个问题:“研究品味(research taste)是什么?”
你几乎参与了深度学习史上多个“节点级事件”:
- AlexNet、
- 序列建模、
- GPT 系列…
外界对你的标签之一就是“研究品味极好的人”。你自己会怎么定义它?
Ilya
我只能从自己的经验讲,别人可能不一样。对我来说,研究品味大概是:
- 有一套关于“智能应该长什么样”的美学直觉。
- 这个美学很大程度上来自对大脑的观察;
- 但必须是“正确地”理解大脑,而不是类比过度。
- 结构上的简洁: 像人工神经元(artificial neuron)这种设计,直觉上就很对:“大脑有很多 neuron,我们也搞很多 neuron;它们从经验中调节连接权重。”
- 经验上的一致: 大脑从经验中学习,好的 AI 也应该从经验中学习,而不是写死规则。
- 数理上的优雅: 真正好的方法,通常有一种“数学上站得住”但又不过度复杂的味道。
- 如果一个方案需要堆很多 ad-hoc 的 hack、case-by-case 的规则,
- 我会本能地觉得“哪里不对劲”。
14.2 顶层信念:当实验说“不”,你要不要继续?
Ilya
还有一个非常关键的点是:顶层信念(top-down belief)。
- 在做新东西时,你几乎必然会遇到很多实验失败;
- 你不可能一开始就把所有 bug、所有坑都预见到;
- 数据会一次次告诉你:“这条路走不通”。
如果你完全“唯数据论”,实验失败几次,你就会 conclude:“OK,这方向是错的。”
但我经历的一些工作,是这样诞生的:
- 先有一个非常强的 top-down 信念:“世界大致必须是这个样子。”
- 然后在一串失败的实验面前,坚持:“问题一定出在实现或细节上,而不是在整体方向上。”
- 不断 debugging,直到找到那个“把一切拉偏的 bug”。
研究品味的一部分,就是分辨:“什么时候应该相信直觉顶层结构,什么时候该老老实实承认自己想错了。”
Dwarkesh
也就是说,“品味”既是你选择问题、判断美感的能力,也是你在黑暗中决定“继续挖还是换地方挖”的指南针。
Ilya
可以这么说。当你确信“智能应该是这样被构造的”,你就会有足够的耐心,去穿越一段“所有实验都在骂你”的时期。
尾声:一场仍在进行中的思想实验
Ilya(结尾)
谢谢,这次聊天我也很享受。
Dwarkesh
我也是。我觉得我们其实在做一件很奇特的事——一边用现有的模型和世界对话,一边在想象那些还不存在的智能形态。
Ilya
是啊,而且很可能:那些形态会比我们现在能想象的,还要再远很多。
结语
当我们顺着这场对话一路走到终点,最让人不安的也许不是“超级智能会不会出现”,而是一个更尖锐的问题:当真正更聪明的心智诞生时,人类究竟还想成为什么? Ilya 一边拆解模型的锯齿能力、预训练的局限和人类惊人的泛化,一边又坦然承认:我们连“进化是如何把价值、情绪和社交欲望刻进大脑”的机制都还没弄懂,却已经在试图复制、放大,甚至超越它。我们口头上谈“对齐”“安全”“管控”,但他给出的几条可能路径——关怀一切感知生命、渐进部署、甚至最终走向 “Neuralink++ 式的人机共生”——无一不是在提醒我们:未来真正需要被设计的,可能不是某个完美的算法,而是整个人类文明愿意以什么样的形式继续存在。也许所谓“研究时代的回归”,不只是回到更艰难、更依赖洞察和品味的科学工作方式,而是被迫重新发明一个问题:在即将到来的超级智能面前,我们能否不再只把自己当作用户、管理者或受益者,而是作为一种仍在学习、仍在改变、仍在承担责任的“共同参与者”?这个问题没人替我们回答——它既不是模型的 loss function,也不是某个 safety 协议的脚注,而是这一代人必须亲手写下的“人类打算怎样与自己的发明共同生活”的长句...
References
Ilya Sutskever – We're moving from the age of scaling to the age of research:https://youtu.be/aR20FWCCjAs?si=IyHee59_5V8LQMZm