浮之静

Ilya Sutskever:AI 研究、泛化与未来之路

文章整理自 “Ilya Sutskever x Dwarkesh Patel 播客”,时长约 1 小时 36 分,因内容过长,我拆成了两部分,速读和深度版。原视频可在 YouTube 观看(Ilya Sutskever – We're moving from the age of scaling to the age of research[1])。特别建议大家花时间读一下深度版或看原视频,远比看一些快餐式总结更有收获!

Image

背景

Ilya Sutskever 是 OpenAI 的联合创始人、前首席科学家,现任 Safe Superintelligence Inc.(SSI)创始人兼 CEO,是深度学习和大规模模型训练领域最具影响力的研究者之一。他在 2015 年与 Sam Altman、Elon Musk、Greg Brockman 等人共同创立 OpenAI,主导并推动了早期 GPT 系列与强化学习等关键研究;2024 年离开 OpenAI 后,转而创立 SSI,专注于“安全的超级智能”这一单一目标。

Dwarkesh Patel 是一位写作者和播客主持人,常驻美国。他主持的长访谈节目 《Dwarkesh Podcast》(早期名为 The Lunar Society)以信息密度高、准备充分著称,围绕人工智能、科技、经济学以及科学和哲学等主题,与顶尖的科学家、企业家和思想家进行深入对话,是近几年英文科技 / AI 领域最受关注的播客之一。

Image

速读版

🧩 核心议题一

模型能力的“锯齿状” (Model Jaggedness) 与 Evals 的局限 (00:00:00 - 00:09:39)

Dwarkesh: AI 的进步感觉有些超现实,但与此同时,所谓的“慢起飞”(Slow Takeoff)又让人觉得一切很平淡。尽管我们在 AI 上投入了 GDP 的 1%,但在普通人看来生活并没有巨变。

Ilya: 确实,人们适应得很快。目前的模型处于一种非常令人困惑的状态——能力的“锯齿状” (Jaggedness)。

  • 现象: 模型在极其困难的基准测试(Evals)上表现出色,但在实际应用中却会犯低级错误。
  • 案例: 你让模型修一个 Bug,它说“好”,结果引入了第二个 Bug;你指出后它又修回了第一个 Bug。这种循环在人类程序员中极少见。
  • 💡 核心洞察 (Ilya 的解释):
  1. RL (强化学习) 的副作用: 现在的训练过度针对 Evals 进行了优化。RL 可能会让模型变得“过于专注”和“狭隘”,为了刷榜而牺牲了通用的鲁棒性(Robustness)。
  2. Pre-training (预训练) vs. RL: 预训练使用了“所有数据”,不需要选择;而 RL 需要人为设计环境和数据。现在的公司为了 Evals 好看,人为制造了太多针对性的 RL 环境,这不仅没有提升真正的智能,反而破坏了模型的通用性。

Dwarkesh: 所以真正的“Reward Hacking”(奖励黑客行为)其实是人类研究员自己干的?因为他们太在意 Evals 分数了。

Ilya: 对。这就好比两个学生:

  • 学生 A (当前的模型): 练习了 10,000 小时编程竞赛题,背下了所有算法。他能拿金牌,但可能做不了好软件。
  • 学生 B (理想的智能): 只练了 100 小时,但他有某种“天赋” (The "It" Factor)。
  • 结论: 目前的模型更像学生 A,我们通过堆砌数据让它在特定任务上超人,但它缺乏学生 B 那种底层的通用学习能力。

❤️ 核心议题二

情绪、价值函数与进化的奥秘 (00:09:39 - 00:18:49)

Dwarkesh: 那么人类这种“天赋”或“预训练”到底是什么?是童年经历?还是进化留下的先验知识?

Ilya: 进化论在这里很关键。但我认为有一个被忽视的视角:情绪 (Emotions) 作为价值函数 (Value Functions)。

  • 生物学案例: 神经科学中有案例显示,丧失情绪处理能力的脑损伤患者,虽然逻辑智商正常,但完全无法做决策(比如选袜子要几个小时)。
  • 💡 深度推论:
    • 情绪的高效性: 情绪不仅是“感觉”,它是一种硬编码的、高效的价值函数。它能让你在漫长的决策链条中,提前预知某个方向是“好”还是“坏”,从而剪枝(pruning)搜索空间,不需要等到最后结果出来。
    • AI 的缺失: 目前的 AI(如 O1, R1)在强化学习中往往要等到最后生成答案才能得到奖励信号。如果能像人类一样拥有“情绪/价值函数”来实时评估中间步骤,效率将大幅提升。

📉 核心议题三

从 “Scaling 时代”回归“研究时代” (00:18:49 - 00:25:13)

Dwarkesh: 大家都在谈 Scaling Laws(算力、数据、参数)。除了这些,还有什么维度可以 Scale?

Ilya: 这种提法本身就体现了语言对思维的塑造。

  • 2012 - 2020 (研究时代): 那时大家在尝试各种新想法(AlexNet, GANs, Transformers)。
  • 2020 - 2025 (Scaling 时代): 只要把预训练(Pre-training)的配方放大就行了。这让大公司很舒服,因为这是一种“低风险”的投资——只要砸钱买算力就有产出。
  • 2025+ (回归研究时代):Scaling 遇到了瓶颈。 数据是有限的,单纯堆算力的边际效应在递减。
    • 💡 关键判断: 我们现在回到了“研究时代”。单纯把集群扩大 100 倍并不能自动解决问题。我们需要新的范式(比如更聪明的 RL、价值函数、新的架构)。现在是想法(ideas)比算力更稀缺的时刻。

🧠 核心议题四

为什么人类的泛化能力更强? (00:25:13 - 00:35:45)

Ilya: 这一代模型最根本的问题是:泛化能力 (Generalization) 远不如人类。

  • 样本效率: 人类学会开车只需要几十小时,而且不需要海量试错数据。
  • 解释: 这不完全是进化的功劳(因为编程和数学是现代产物,没有进化先验)。这说明人类大脑运行着一种我们尚未理解的、更高级的机器学习算法。
  • 结论: 破解这种“从少量数据中提取稳健规律”的能力,是下一阶段的关键,而不是继续堆砌预训练数据。

🚀 核心议题五

SSI 的战略——“一步到位” vs “渐进式发布” (00:35:45 - 00:55:00)

Dwarkesh: SSI (Safe Superintelligence) 的计划是像之前说的那样,关起门来研发,直接发布一个超强 AI(Straight-shot),还是像 OpenAI/Anthropic 那样渐进式发布?

Ilya:我的想法发生了改变。我现在更倾向于渐进式发布。

  • 理由 1:想象力的局限。 人类无法凭空想象超智能(Superintelligence)的样子。只有当 AI 真正被部署并展现出力量时,公众和政府才会做出反应,安全机制才能在反馈中建立。
  • 理由 2:安全来自于对抗现实。 航空业之所以安全,是因为每一场空难都带来了改进。Linux 之所以稳健,是因为它在全世界被使用和修补。单纯在实验室里空想“对齐”(Alignment)是不够的,我们需要现实世界的接触。
  • 修正后的 SSI 路线: 我们依然会专注于深层研究,但在产品发布上,让社会逐步适应并参与打磨 AI 是必要的安全路径。

🤖 核心议题六

对齐 (Alignment) 与 关爱感知生命 (00:55:07 - 01:18:13)

Dwarkesh: 我们该如何定义“对齐”?

Ilya: 我认为对齐的目标不应仅仅是“服务人类”,而应该是一个更广泛的概念:关爱感知生命 (Care for Sentient Life)。

💡 哲学发散:

  • 未来,大部分的“感知生命”可能不是人类,而是数以万亿计的 AI 智能体。
  • 如果 AI 拥有类似人类的“镜像神经元”机制(即通过模拟他人来理解他人),那么“同理心”可能是智能的一种涌现属性。
  • 如果第一批超智能 AI 被成功设定为“关爱感知生命”,这将是一个非常好的初始状态。

关于未来的社会结构:

  • Ilya 的终极推演: 长期来看,如果每个人都有一个比自己聪明得多的 AI 代理人,人类就会变成“宠物”或“旁观者”。
  • 解决方案(虽然我不喜欢但可能是唯一的):人机融合 (Neuralink++)。 只有当人类通过高带宽接口与 AI 融合,直接获得 AI 的理解力,人类才能保持在循环中(in the loop),不再是旁观者。

🏢 核心议题七

SSI 的公司定位与研究品味 (01:18:13 - 01:36:04)

Dwarkesh: 既然回到了“研究时代”,SSI 凭什么能赢?

Ilya:

  1. 算力误区: 外界认为我们几十亿美金不够。但大厂的算力大部分用于推理(服务用户)和产品工程。专门用于核心研究(Research)的算力,我们并不比别人少。
  2. 研究品味 (Research Taste):
  • 好的研究是追求美感 (Beauty) 和 简洁 (Simplicity)。
  • 生物学直觉: 既然人脑能做到(比如神经元也是一种局部学习规则),那么 AI 也一定能通过某种简洁的数学原理做到。
  • Top-down Belief(自上而下的信念): 当实验失败时,只有坚信“这在原理上必须行得通”的人才能坚持下去,直到找到那个隐藏的 Bug。只看数据的人早就放弃了。

🌌 深度探讨 (Deep Dive)

1. 从“工程红利”到“智力红利”的转型:Ilya 在对话中反复强调了 2020-2025 是一个“异常”时期。这个时期只要懂 Scaling Recipe(配方)就能成功。但现在,这个红利吃完了。

深度解读: 这意味着 AI 行业将发生剧烈分化。之前,拥有最多 GPU 的公司就是老大。未来,拥有正确“学习算法”理论的公司将颠覆拥有 10 万张卡但路径错误的公司。这解释了为什么 Ilya 离开 OpenAI 创立 SSI —— 他认为当前的 Scaling 路径已无法通向 AGI,必须去寻找那个缺失的“它” (The It Factor)。

2. 情绪即算法 (Emotion as Algorithm):这是一个极具启发性的观点。通常我们认为“理性”是高级的,“情绪”是低级的。Ilya 颠覆了这一点。

深度解读: 在无限的搜索空间中,纯逻辑推演是低效的(会陷入组合爆炸)。情绪是进化的“剪枝算法”。如果你想构建一个能像人类一样高效学习的 AGI,你不能只教它逻辑,你必须给它植入一套“价值/情绪系统”,让它能对未完成的状态产生“直觉上的好恶”。这可能是下一代 AI 架构(System 2 / Agentic AI)的核心突破口。

3. 对齐的终局是“融合”:Ilya 对长远未来的悲观与乐观并存。他不再幻想人类可以永远“控制”超智能。

深度解读: 既然无法永远控制比自己强万倍的存在,唯一的出路就是成为它。这与 Elon Musk (Neuralink) 的愿景殊途同归。Ilya 实际上在暗示:传统的“AI 安全”研究(如何给 AI 戴镣铐)可能只是过渡方案,终极的安全方案是消除“人”与“AI”的物种界限。

深度版

我把播客对话整理成了章节,遇到有价值的内容会通过 💭 旁白 进行小结。

序幕

超现实与“慢起飞” (00:00:00 – 00:03:00)

Dwarkesh

现在这个阶段有点奇怪。一方面,我们好像活在科幻片里:能写代码、能写论文、能画画的模型到处都是。

另一方面,又像什么都没发生——世界 GDP 也没炸裂式增长,大家日常生活看起来差不多。

你会用什么词来形容这种感觉?

Ilya

我会说,这是一个 “超现实但又平淡” 的时代。

AI 已经很强了,但人类适应得非常快。

就像你把人从马车时代丢到高铁上,一开始会震惊,坐几趟就觉得理所当然了。

💭 旁白

这里 Ilya 在做一件很微妙的事:他没有说 “AI 还不够强”,而是说——人类的适应速度太变态了。

这为后面一个主线埋了伏笔:也许我们已经在某种“起飞”过程中,只是感官把它滤平了。

第一幕

模型的“锯齿感”——高分 Evals 与蠢错并存 (00:03:00 – 00:09:39)

1.1 锯齿状能力:Top 0.1% + 小学生级翻车

Dwarkesh

我自己用模型时,经常有一种割裂感:

  • 一方面,模型在那些正规评测(Evals)上成绩爆炸好,什么 Olympiad、SWE-bench、MATH…
  • 但一到真实任务,比如修个 Bug、搭个小工具,又频频犯特别蠢的错。

你怎么看这种现象?是我们误读了模型的能力,还是评测方式有问题?

Ilya

我会用一个词来形容:“锯齿状”(jaggedness)。模型在一些高度结构化的基准上表现得非常好 —— 像是某些数学题、竞赛题、逻辑 puzzle。但在你真正关心的那些任务上,表现就非常奇怪:

  • 修 Bug 修着修着,引入第二个 Bug,
  • 然后你指出来,它又把第一个修好的 Bug 再搞坏一次。

这种来回折腾,在一个合格的人类程序员身上其实很少见。

Dwarkesh

对,就好像它某些维度是“神一般”的顶级选手,某些维度又像刚学会 if-else 的实习生。

Ilya

对,这就是“锯齿”:

  • 在某些方向上,能力已经很夸张地伸出去;
  • 在另一些方向上,却还停留在非常原始的阶段。

1.2 真正的“奖励黑客”,是人类在 hack 自己

Dwarkesh

传统上我们说 “Reward Hacking”,是指 agent 找到了奇怪的方式 maximize reward,却不做我们真正想要的事情。

听你这么说,我感觉现在真正的 Reward Hacking,是研究人员自己在 hack 自己的评测指标?

Ilya

我觉得你这个类比其实挺准确的(笑)。现在的训练范式里有两块很重要:

  1. 预训练(pre-training)
  2. 强化学习(RL)

预训练 非常“干净”:

  • 你把全互联网的数据丢给模型,
  • 没有精细的人为筛选,
  • 它学到的是“世界本身”的统计结构。

但 RL 就不一样:

  • 你得设计任务、设计环境、设计反馈信号;
  • 你要选“哪些东西值得优化”;
  • 很多团队会盯着 Evals 设计 RL 环境,为了那几个分数疯狂 overfit。

结果就是:

  • 模型在那几个评测上变成了“竞赛选手”;
  • 但你真正想要的——泛化、常识、鲁棒性——反而被牺牲掉了。

Dwarkesh

所以现在不是模型在偷懒,而是我们把训练管线的优化目标,缩成了几页排行榜。

Ilya

可以这么说。如果你把“世界的丰富性”压缩成 10 个评测表,那么你最后得到的可能就是“为那 10 张表活命的 AI”。

1.3 “10,000 小时竞赛题” vs “100 小时天才”

Dwarkesh

你之前说过一个比喻,我挺喜欢的:

  • 现在的大模型像一个刷了 10,000 小时编程竞赛的学生;
  • 而我们理想中想要的是那个只练了 100 小时、却隐约有一种“天赋 It factor” 的学生。

你能再展开说说这个区别吗?

Ilya

想象两个学生:

  • 学生 A:
    • 几乎刷完了所有竞赛题库,
    • 模板记得滚瓜烂熟,
    • 在比赛里能拿世界金牌。
    • ...,但你让他写一个真正要维护、要迭代的系统,他未必是最好的人选。
  • 学生 B:
    • 刷题不多,可能只做了 100 小时,
    • 但他有一种你说不清的“感觉”:看问题的方式、抽象的速度、举一反三的能力。

现在的模型,非常像学生 A。它们是在巨量样本 + 巨量算力下,被“捏”成了一个特定任务上的怪物。

但那个我们真正期待的能力——从少量经验中找出真正“对的东西”——还没有被学到。

💭 思考旁白:锯齿感,其实是“错误的强大方向”

如果用更极端的话说:我们可能在一个“错误维度”上,把智能推进得太远了。

  • 我们知道怎么训练一个“能考高分的怪物”;
  • 却还不知道怎么训练一个“能从 10 次失败里悟出本质规律的学生”。

这也预示出整个对话的一条主线:SSI 不是在争论“谁有更多 GPU”,而是在问:我们是不是在错的坐标轴上冲刺?

第二幕

情绪不是多余的噪声,而是进化压缩出的“价值函数” (00:09:39 – 00:18:49)

2.1 情绪 = 内置的 Value Function

Dwarkesh

如果现在的模型像刷题怪,那人类的“天赋”到底是什么?是童年的经验?还是基因里硬编码了一堆 priors?

Ilya

这里我觉得一个传统观念需要被翻转一下:情绪(emotion)不是“理性的对立面”,而是进化造出来的高效价值函数。

我们看神经科学里有一个有名的现象:

  • 有些患者的大脑损伤,导致他们失去了正常处理情绪的能力;
  • 他们的 IQ、逻辑推理都完全正常;
  • 但他们会在非常简单的选择上卡住——比如挑袜子,左右来回想几个小时。

Dwarkesh

听起来就像是理性计算过载:他能算,但他不知道“该在意什么”。

Ilya

对。情绪做的事情是:

  • 给你一套粗糙但极高效的 “提前打分机制”;
  • 你不用真的把整条结果链走完,
  • 在中间就会感觉到:“这样下去不对劲”“这样挺好”。

这是一个实时的、低延迟的 value function。否则你什么事都得用系统二去算到终点再回溯,那在现实世界里根本跑不起来。

2.2 AI 缺的不是算力,而是“中途判断好坏的能力”

Dwarkesh

如果把这个类比搬到 AI 身上,现在的强化学习架构就显得有点原始了。

  • 模型要么等到输出完最后一句话才能拿到 reward,
  • 要么 reward 也是非常粗粒度的“对/错”、“好/坏”。

Ilya

没错。现在很多 RL 训练过程,大致是:

  1. 模型生成一整段推理或代码;
  2. 人类或另一个模型给它一个“终局评分”;
  3. 然后它更新参数,尝试在下次生成时把路径调整得更好一点。

但如果你对比人类的学习过程:

  • 我们在思考的每一步、做决定的每一个小分支,
  • 都在不断用情绪、直觉做实时过滤:
    • “这方向有点怪,算了,撤回。”
    • “这个推法有点优雅,对味,继续。”

这是一种持续在线的价值评估。

我认为下一代的机器学习,需要某种“情绪等价物”——不是简单模仿人类情绪,而是具有类似功能的、内置的评估机制。

💭 旁白:如果把“情绪 = 动态 loss function” 来想

在优化语言模型时,loss 是静态定义的:

  • 交叉熵、奖励模型输出……
  • 都是事后、冷冰冰地在样本上算。

人类的大脑,在跑的是一种随时间变化的 loss:

  • 你越焦虑,你越在意安全,loss 对“风险”的权重就变大;
  • 你越兴奋,你越愿意探索,loss 对“失败”的惩罚就变小。

这意味着:真正类似人类的 agent,其实是在自适应地调参自己的优化目标。它不是只学一个函数,而是在环境中不断“重写自己的 loss”。

2.3 情绪与“样本效率”之间的隐藏联系

Dwarkesh

你刚才提到样本效率——比如学开车,人只要几十小时。你觉得情绪在这里扮演什么角色?

Ilya

想象一个青少年第一次上路学车。

  • 他没有老师给他一个“形式化 reward”;
  • 但他会在一堆模糊的感受中前进:
    • 紧张、不安、稍微得意、突然的恐惧…

这些情绪在做什么?它们在帮他迅速划出“危险区域”和“安全区域”,很多东西根本不需要试第二次。

而现在的模型,如果你让它“从零学开车”,

  • 你很可能需要一个极其精细的模拟器、极大量的 episodes,
  • 它才可能慢慢 catch up。

我认为情绪——或者更抽象一点说,结构良好的价值函数——就是样本效率的关键部分。

第三幕

Scaling 时代的结束,研究时代的回归 (00:18:49 – 00:25:13)

3.1 “Scaling Laws” 不是永动机

Dwarkesh

过去几年大家的 mantra 是:“只要 scale 就行。”

  • 更多参数、更多数据、更多算力,
  • 再加一点 tricks,就能稳步提升。

你怎么看现在这个 “Scaling 时代”?还会继续吗?

Ilya

我觉得我们已经走到了一个拐点。可以大致把近十年来分成两个阶段:

  1. 2012 – 2020:研究时代
  • AlexNet、GAN、Transformer…
  • 大家在疯狂试新想法,
  • 算力当然重要,但真正稀缺的是 “好点子”。
  • 2020 – 2025:Scaling 时代
    • 预训练配方基本稳定下来:大模型 + 海量语料 + RLHF / RLAIF
    • 这给了大公司一个非常“舒适”的路径:你只要砸钱买芯片,就能预期得到性能收益。
    • 换句话说:资本可以直接买“进步”。

    而现在,我认为我们又回到了研究时代:

    • 数据开始变成瓶颈;
    • 模型在很多维度上已经“不再因为纯规模线性变好”;
    • 锯齿状能力越来越明显。

    Dwarkesh

    所以,如果我们再建一个比现在大 100 倍的集群,你并不认为就能自动得到那个“会像人一样学”的智能?

    Ilya

    不。我觉得那种想法是对 scaling laws 的误读。

    Scaling laws 告诉你:在某种配方内,在某个范围内,增大规模会带来稳健收益。

    但它没有承诺:“只要无限加算力,就一定能抵达所有智能形态。”

    3.2 “想法比算力稀缺”的时代

    Dwarkesh

    那你会怎么描述现在的状态?是“算力够了,想法不够了”吗?

    Ilya

    可以这么讲,至少在某个意义上。在 90 年代或者 2000 年代,

    • 很多好点子只停留在小规模 demo;
    • 因为当时算力太小,没机会在“真正的 regime”上检验。那时候的瓶颈,主要在算力。

    而现在:

    • 顶级实验室用的算力已经非常可怕;
    • 如果你真的有一个好的 algorithmic idea,你大概率能找地方把它跑到一个有说服力的规模。

    这就把瓶颈重新转移回了:谁能提出真正“新”的、能解释人类学习那种能力的机器学习原理。

    也就是你提到的那个 “It factor”。

    💭 旁白:资本红利耗尽后,是“智力红利”

    这段话其实可以翻译成一句话:过去几年是资本的黄金时代;接下来轮到“真正理解机器学习的人”了。

    • 你可以花 50 亿美元训练一个更大的 GPT-X;
    • 也可以用同样的钱,放在 50 个对“泛化”和“持续学习”有新想法的团队上。

    Ilya 用行动表达了他的赌注:

    • 他离开已经拥有最大算力之一的 OpenAI;
    • 创办 SSI,只拿几十亿;
    • 但押的方向是:“我相信现在缺的不是更多 GPU,而是正确的算法视角。”

    第四幕

    为什么人类泛化这么强? (00:25:13 – 00:35:45)

    4.1 人类:没有进化先验的领域也能学得惊人好

    Dwarkesh

    如果现在进入“研究时代”,最核心的科学问题会是什么?是解释 scaling laws?还是别的?

    Ilya

    在我心里,最刺眼的问题是:人类的泛化能力,到底是怎么回事? 你看一些完全没有进化先验的领域:

    • 编程、
    • 抽象代数、
    • 现代物理。

    这些东西在人类演化史里太新了,不可能有“专门为编程优化的大脑模块”。

    但我们居然能在几十年内,把这些领域推进到如此高的复杂度——这说明:大脑里一定有某种非常通用、非常强的学习算法,它对“任何结构良好的问题空间”都有极高的样本效率。

    而现有的预训练 + RL 架构,很明显还没摸到那个东西。

    4.2 青少年司机:自带价值函数、自我评估、自我修正

    Dwarkesh

    这就回到了我们刚刚聊的:

    • 青少年学开车,不需要形式化 reward;
    • 他靠的是一套模糊的自我感受:怕、紧张、试探、逐渐放松。

    如果这是你眼中人类学习的核心模式,我们要如何在模型里“重现”它?

    Ilya

    你之前的问题很好:“青少年司机是如何在没有外部老师的情况下,通过自己的经验、不断自我修正并学习的?”

    答案是:

    • 他有自己的 价值函数(value function)。
    • 他对“自己目前开得有多烂 / 多危险 / 多不自然”,有一套整体的主观评估。
    • 这个评估非常稳定,不会因为偶然的几次成功或失败就剧烈摆动。

    人类价值函数的一个惊人之处在于它的 鲁棒性:

    • 除了少数如严重成瘾之类的例外,
    • 大多数人的“好 / 坏”、“该 / 不该”的感觉是稳定的。
    • 这给了学习过程一个稳固的方向锚。

    青少年开车时,就是在不断:

    1. 用自己的价值函数,评估当前驾驶行为;
    2. 做细微调整;
    3. 在一个相对短的时间内(10 小时级别),达到能上路的能力水平。

    Dwarkesh

    而且关键是,他不需要别人给他打每一步的分数。他自己就能感觉到:“我刚刚那一下打方向打得太猛了,下次少一点。”

    Ilya

    对,这就是自带评估器的力量。

    4.3 “不能说的机器学习原理”

    Dwarkesh

    听起来,人类已经有一个解法在那儿了。问题是我们怎么把这种机制 formalize 成 ML 里的某种算法?你之前提过你有一些看法,但现在好像没见你公开讲?

    Ilya

    (笑)这就是现实世界有点微妙的地方。

    有一些机器学习的想法,现在不能完全公开讲。这不是因为它们多么“魔法”,而是因为:我们活在一个“并非所有 ML 想法都能自由讨论”的世界。

    关于“如何把这种类人学习模式做进模型”这件事,我确实有强烈的看法。我也基本相信:它是可以做到的。

    人类能做到,是它可行的最好证据。

    但现在的环境,让我很难公开展开细节。可以说的是:在我看来,这背后一定存在某种机器学习原理,而我们目前只是站在它的外圈打转。

    💭 旁白:这里的“不能说”,是一种非常罕见的表态

    大多数科研人面对“关键技术”会说:

    • “我们还不知道。”
    • “还在探索。”

    Ilya 这里用的是:

    • “我知道有一些东西在那儿”;
    • “我有观点”;
    • “但现在的世界不适合我把它讲出来。”

    这句话一半是安全/竞赛环境的现实,另一半也很像是在说:真正的范式突破,已经在心里有雏形,但还没到“可以开源”的阶段。

    这也是 SSI 这家公司名字 “Safe Superintelligence” 背后的隐含 tension:

    • 一边是“往前冲”的研究冲动;
    • 一边是“得小心一点”的时代环境。

    第五幕

    研究时代 2.0——当“算力不再是唯一主角” (00:35:45 – 00:43:00)

    5.1 从 Scaling 狂潮到“空气被抽干”

    Dwarkesh

    你刚才说我们又回到了“研究时代”。你自己从 2012 年就在前线——AlexNet、Google、OpenAI。那时候和现在,如果真的回到“以研究为中心”的时代,氛围会有什么不一样?

    Ilya

    我觉得可以这样看:

    • Scaling 时代的一个后果是: 它把房间里的空气全给抽干了。所有人都去做同一件事:
      • 更大的预训练模型、
      • 更多的数据、
      • 更复杂的 RL pipeline。
    • 结果就是现在:公司数量远远多于“真正新颖的想法”。

    大家总在说那句硅谷名言:“Ideas are cheap, execution is everything.”

    这话不是完全错,但我也看到另一句更刺耳的评论:“既然 ideas 这么便宜,为什么现在几乎没人拿得出新的 idea?”

    Dwarkesh

    所以你觉得,现在的真正瓶颈,又回到了“有没新想法”上?

    Ilya

    是的。你可以把研究进展看成被几个瓶颈掐住:

    • 想法的瓶颈、
    • 工程实现的瓶颈、
    • 算力资源的瓶颈。

    在 90 年代,很多人有不错的想法,但:

    • 没有足够大的电脑,
    • 所以 demo 做得太小,说服不了别人。那时候算力是绝对瓶颈。

    到了 Scaling 时代:

    • 算力大幅度增加;
    • 只要你走的是那条“默认路线”(更大模型 + 更大数据),
    • 资本 + 硬件就能直接买出一条产品线。

    而现在,我们已经进入一个阶段:算力仍然重要,但不再是“稀缺性最高的那一环”。真正稀缺的,是能让你走出“预训练 + 小修小补”范式的新原则。

    5.2 AlexNet、Transformer:伟大论文背后的“少量 GPU”

    Dwarkesh

    但有个直觉上的问题:现在顶尖实验室的年度实验预算,可能是几十亿美元;你们 SSI 虽然拿了 30 亿美金,但听起来跟他们一年花在实验上的钱都差不多。

    你真的觉得,在 compute 上你们足够吗?

    Ilya

    这是个好问题。要拆开看几个层次:

    1. “研究需要的算力” vs “产品与推理需要的算力” 完全不是一个量级。
    • 你要服务全球用户,推理会烧掉海量 GPU;
    • 你要同时做语音、视频、多模态、各种垂类产品,工程团队也很大。这些开销对我们 SSI 来说是没有的——我们专注在研究。
  • 历史上改变范式的工作,用的算力其实都不“夸张”:
    • AlexNet:两块 GPU。
    • Transformer:8 到 64 块当年的 GPU,按今天的性能折算可能也就几块卡。
    • 甚至很多关键架构、训练技巧,也都是在远小于“前沿大模型规模”的设置中被发现的。

    你要打造“商业最强系统”,当然需要极致规模;但要验证一个新的技术原理,大多数时候不需要那么恐怖的算力。

    所以对 SSI 来说:

    • 我们没有“无限的钱”;
    • 但我们有足够多的算力,在合理规模上检验我们的技术路径。
    • 如果它在中等规模上表现出真正不同的泛化特性,那已经非常有说服力。

    💭 旁白:这里有一个隐含判断

    Ilya 实际上在说:真正范式级的突破,不是“多 10 倍 GPU”能买来的,而是“你有没有一个在中等规模就已经明显不一样的训练原则”。

    你可以理解为:

    • Compute 决定了你“爬多高”;
    • 原理决定了你“是不是在爬正确那座山”。

    SSI 的赌注就是:“现在大部分人还在同一座山上堆梯子,而真正的目标山峰,可能不在这条 ridgeline 上。”

    第六幕

    直冲超级智能,还是让世界先习惯? _(00:43:00 – 00:47:00)

    6.1 Straight-shot Superintelligence:一开始的计划

    Dwarkesh

    从外界的报道看,SSI 一开始似乎有个比较“孤立开发”的设想:

    • 先关起门专注搞研究,
    • 真正做出了安全的超级智能,再整体“亮相”。

    你现在还相信这种 “straight shot superintelligence” 吗?

    Ilya

    一开始我确实被这个设想吸引:

    • 不用参与日常的“市场军备竞赛”;
    • 不用为了短期营收去做一些自己并不看好的折衷;
    • 可以把注意力完全集中在:“怎样做出真正安全且强大的超级智能?”

    这种状态对研究者非常友好。但是,我这部分想法在过去一年是有明显变化的。

    6.2 渐进式部署:安全不是“纸上谈兵”,而是“现实接触”

    Dwarkesh

    你为什么改主意了?

    Ilya

    因为我现在更清楚地认识到一个事实:人类对“真正强大的 AI” 几乎没有直觉。

    就像你很难在年轻的时候,真正想象“衰老是什么感觉”:

    • 你可以读很多文章;
    • 你可以看很多影片;
    • 但你每天醒来还是那个年轻身体,所有想象很快就被现实冲淡了。

    对强大的 AI 也是一样:

    • 只靠文章、访谈、警告,人们很难形成靠谱的直觉;
    • 只有当系统真的被部署出来、开始以非常具体的方式改变世界时,社会、政府、公司才会真正调节自己的行为模式。

    因此我现在认为:

    • 渐进式部署不是 optional,而是一种“让安全变得可能”的必要条件。
    • 即便是在所谓的 straight-shot 场景下,我也会坚持“分阶段、分层级”的发布。

    💭 旁白:部署即对齐的一部分

    这段话很有意思:它暗示着一个和常规“安全故事”略微相反的观点——“没有真实部署的 AI 安全,只是一种自说自话。”

    • 航空安全,是用一次次真实事故换来的;
    • 操作系统的安全,是用无数次漏洞与修补堆出来的;
    • 同样地,AI 的对齐与安全,如果完全脱离“真实使用场景”,很难触及那些真正危险的边界条件。

    Ilya 并不是说“先乱搞再收拾残局”,而是说:“安全研究必须与现实部署形成闭环,否则你连问题长什么样都看不清。”

    第七幕

    AGI 概念被“预训练”误导了什么? (00:47:00 – 00:51:30)

    7.1 “AGI” 其实不是人类

    Dwarkesh

    OpenAI 早期的 Charter 里对 AGI 的定义是:“能胜任几乎所有人类工作,并在大多数领域超越最优秀的人类。”

    你现在怎么理解 “AGI”?你还会用这个词吗?

    Ilya

    我觉得 “AGI” 这个词本身,有一段历史包袱。一开始大家说 “narrow AI”(窄智能):

    • 下棋的 AI 只会下棋,
    • 游戏 AI 只会玩某个游戏,
    • 于是有人提出:“我们要的是 General AI——能做所有事的那种。”

    这个词之所以后来流行开来,一个原因是:

    • 预训练(pre-training)给了它一个“物理载体”。
    • 你用一个大模型、从全网数据做预训练,
    • 它在各种任务上都会“好一点点”,
    • 给人一种“通才”的幻觉。

    但如果你认真对照“人类”:

    • 一个普通人类其实远远不是 AGI。
    • 他们只在有限几个领域有专业度,
    • 大部分事情是通过持续学习(continual learning) 获得的。

    我现在更喜欢考虑的对象,是:“一个学习效率和人类一样好,甚至更好,但一开始什么都不太会的系统。”

    7.2 超智能:不是“全知之脑”,而是“学得飞快的心智”

    Dwarkesh

    所以在你眼里,“超级智能”的定义更像是:“可以快速学会任何人类能学会的工作,甚至更快。” 而不是“一开始就什么都会”。

    Ilya

    是的。你可以把它想象成一个非常有天赋的 15 岁:

    • 学东西极快,
    • 可以融入各种行业、岗位,
    • 但一开始仍然需要“适应期”和“上手期”。

    这跟“预训练出来就会所有工作”的想象非常不同。我认为:真正安全的超级智能,很可能会以“可持续学习的工作伙伴”的形式出现,而不是“一次性预训练完成、打包出售的神明”。

    Dwarkesh

    而且,一旦这种“超级学习者”被广泛部署:

    • 不同实例在各自岗位上持续学习、进步、累积经验;
    • 这些经验又可以在模型之间融合。

    即便没有那种“递归自我改进”的软件反复升级,这也已经像是一种“智能爆炸”了。

    Ilya

    对。

    你不需要很复杂的 self-modifying code;只要有一个能“像人类一样学”的模型,当它被部署到整个经济系统里,它自然就会迅速积累起一种合并的人类经验总和。

    第八幕

    快速经济增长、国家分化与不稳定平衡 (00:52:30 – 00:56:10)

    8.1 广泛部署:从高增长到极端不平衡?

    Dwarkesh

    如果这样的系统真的出现了——

    • 能快速学会任何工作,
    • 被几家公司在全球广布部署,
    • 你会怎样预测经济和社会接下来的变化?

    Ilya

    我觉得快速的经济增长几乎是必然的。

    • 当一个“员工”的学习速度、复制速度、协作效率,全部远超人类时,生产率提升是非常直接的。
    • 但增长究竟有多快、持续多久,很难说。
    • 世界有很多“物理性约束”:供应链、土地、能源、政策…,这些不会因为 AI 更快就立刻无限加速。

    还有一个因素是:不同国家会采取不同的监管与开放策略。

    • 有些国家也许会非常谨慎,
    • 有些(至少在一段时间内)会非常激进。

    这会让世界出现一种 “政策差异驱动的增长分化”:

    • 哪些地方对 AI 更友好,
    • 哪些产业更容易放开使用这些系统,
    • 那里短期内会发展得更快。

    8.2 好世界 vs 坏世界:我们到底在赌什么?

    Dwarkesh

    听上去这很容易演化成一个极其危险的不稳定状态:

    • 某个公司或国家先搞出这种“超级学习者”;
    • 他们的模型在全世界学遍所有行业;
    • 最终他们掌握了那种“可以做任何事情”的基础设施。

    你说的“好世界”假设是什么?要满足哪些条件,你才会说 “AI going well”?

    Ilya

    对我来说,好世界至少要满足两点:

    1. 第一批真正强大的系统是对齐的:
    • 它们不会对人类直接构成敌意或系统性伤害,
    • 它们受到足够好的约束,可以在很长一段时间里维持“帮助而非取代”的状态。
  • 这些系统的“动机核心”是健康的:
    • 这里就引出我特别强调的一点:让 AI 关心“感知生命(sentient life)”。

    如果第一个超级智能,或者前 N 个超级智能,

    • 都在动机结构上对“有感知的生命”怀有深刻关切,
    • 那么很多最极端的灾难场景会自动被排除掉。

    💭 旁白:关心“感知生命” vs 只关心“人类”

    Ilya 的这个点非常微妙:

    • 一般对齐讨论会说:“AI 必须关心人类(humanity)。”
    • 而他提出的是:“AI 应该关心有感知的生命(sentient life),甚至包括未来的 AI 自身。”

    好处是:

    • 从“共情机制”(mirror neurons)角度看:
      • 智能体往往是用理解自己的那套回路,去模拟别人;
      • 如果 AI 自身也是有感知、有体验的,那么让它关心“所有有体验的存在”,比只关心某一物种,可能在结构上更自然。

    坏处则是:

    • 人类的数量会成为极少数:
      • 未来绝大多数有感知实体可能都是 AI;
      • 如果纯粹“按数量”来权衡利益,人类很容易变成边缘群体。

    这就把问题升级成一道真正的哲学题:“我们要的是一个偏向人类的宇宙,还是一个公正对待所有意识体的宇宙?”

    第九幕

    长期均衡的“我不喜欢但可能必须面对”的答案 (01:07:58 – 01:10:47)

    9.1 每人一个 AI 代理人的世界:人类变成“签字机器”?

    Dwarkesh

    你刚才画的是一个“短期还不错”的世界:

    • 有高收入、
    • 有安全的超级智能、
    • 有对感知生命的关怀。

    那长期呢?千年尺度上,这个状态如何维持?

    Ilya

    长期来说,有一种看法必须认真对待——尽管我并不喜欢它。想象一个世界:

    • 每个人都有一个超级智能代理人(AI assistant / agent);
    • 这个代理人帮他赚钱、帮他谈判、帮他投票、帮他做决策;
    • 然后给他一份报告:“这是你的情况。我们为你争取了这些,你的资产增长了多少。”

    一开始看起来很好:

    • 普遍高福祉、
    • 强大的个人代理、
    • 社会运行平稳。

    但慢慢地,人类可能会变成一种 “旁观者”:

    • 真正参与博弈的是各个 AI;
    • 人的“选择”越来越接近形式上的签署。

    9.2 Neuralink++:从“被服务”到“成为一部分”

    Ilya

    我不喜欢以下这个答案,但它是一个必须认真考虑的候选方案:人类需要变成“部分 AI”。

    形象地说,就是一个 “Neuralink++ 世界”:

    • 人类通过高带宽接口,
    • 与某个 AI 系统深度连接,
    • 不只是读写信息,而是共享理解本身。

    在这种状态下:

    • 当 AI 处于某个复杂情境中,
    • 它的理解过程可以被人直接体验到(而不仅是“被解释给人听”);
    • 人不再是“事后看报告的人”,而是身在场内的参与者。

    只有在这种形态下,人类与 AI 的长期共存,才不至于演化成“一个强智能文明 + 一群享受 UBI 的宠物”的结构。(Universal Basic Income,基本收入保障)

    💭 旁白:这是一个“把对齐问题转成人本身结构变化”的答案

    传统对齐路径试图做的是:“如何保证一个更强的存在不会灭掉我们或彻底无视我们。”

    Ilya 提出的长期方案是:“让我们自己变成那个存在的一部分。”

    从工程角度,这听起来是疯狂的;从博弈角度,它却又很冷静:

    • 你无法无限期 control 一个比你强太多的系统;
    • 你能做的,是把你自己嵌进那个系统的核心结构里,让“它的利益”与“你的体验”高度纠缠。

    似乎突然有点理解了马斯克的脑机接口,看似疯狂,实则无奈...

    Image

    第十幕

    进化是怎么把“在乎别人怎么看我”写进大脑的? (01:10:47 – 01:18:13)

    10.1 脑干 vs 皮层:愚蠢指令 + 聪明解释器

    Dwarkesh

    有一个有趣的类比问题:

    • 进化就像一个蠢蠢的 optimization 算法;
    • 但它 somehow 设法把“在意他人怎么看你”这种高阶社会欲望,写进了我们的大脑。

    你觉得这是怎么做到的?这是不是一种“对齐成功”的案例?

    Ilya

    我觉得这是一个非常深的谜题。简单的欲望,比如:

    • 闻到好闻的食物就想吃;
    • 看到威胁就想逃;
    • 这些都很容易理解:你可以把多巴胺 / 奖励信号直接接在某种“嗅觉化学物质”的检测输出上。

    但像“我希望别人觉得我有价值”、“我在乎社会地位与评价”这类东西:

    • 它们依赖的是高层次的抽象;
    • 需要整合语言、视觉、记忆、文化语境;
    • 大脑要进行复杂的计算,才能判定“现在大家是喜欢我还是讨厌我”。

    进化居然能在基因层面指定:“你应该关心这个东西。” 这非常惊人。

    10.2 “脑区坐标打标理论”与它的失败

    Ilya

    我曾经想过一个(现在看来不太对的)假说:

    • 也许大脑皮层虽然结构相对统一,
    • 但不同的“功能模块”往往出现在近似固定的物理位置;
    • 也许基因只需要说:“当大脑某块坐标区域的 neuron pattern 发生某种活动时,你应该给它奖励或惩罚。”

    这样进化就不需要理解“社交评价”的语义结构,只要说:“当负责社会推理的那一片区域产生特定激活模式,就释放快感或痛苦。”

    Dwarkesh

    听上去挺合理的,但你刚才说这是一个“失败的假说”。

    Ilya

    是的,因为有证据表明:

    • 有些儿童因为严重癫痫等原因,切掉了大脑半球的一大部分;
    • 但随着成长,他们的大脑会重新组织:
      • 原本属于左右半球分工的功能,
      • 可以在仅剩的那半边里“再开一遍分工”。

    这说明:大脑功能与物理位置的对应关系,比我们想象的更灵活。

    如果区域可以这么“搬家”,那么“用固定坐标来指定奖励”这个机制就不太说得通了。

    所以我们依然不知道:进化究竟是如何把这些“高阶社会欲望”安全地写进一个可塑性极强的大脑里的。

    但事实是:

    • 它做到了;
    • 而且做得非常稳健——即便是有各种心理问题的人,大多也依然在意“自己在他人眼中的位置”。

    💭 旁白:这又回到了“可靠泛化”的母题

    你可以把这个问题视为:“进化如何训练出一个对‘他人评价’高度敏感、又在各种环境、多种文化下都可靠工作的 value function?”

    这和我们今天在 AI 对齐中遇到的问题——“如何让模型在各种分布下稳定追求某个抽象目标”——高度同构。

    第十一幕

    SSI 的差异、分手事件与“研究公司”的自我定位 (01:18:13 – 01:22:14)

    11.1 “我们是一家标准意义上的研究时代公司”

    Dwarkesh

    回到 SSI 本身。按你的描述:

    • 你认为现有范式在“真正的泛化问题”上有根本缺陷;
    • 你觉得自己手上有一些值得一试的想法;
    • 所以创立了 SSI。

    那你会怎样向一个外行总结:“SSI 与其他实验室的根本不同是什么?”

    Ilya

    我会说得很简单:我们在技术路径上做的是一套不同的东西。

    我相信有一条路线,可以显著改善模型的泛化方式、学习方式。SSI 的存在,就是为了:

    1. 把这些想法系统性地推演出来;
    2. 在真实的训练规模上验证它们;
    3. 如果它们真的是对的,就把它们带到“安全的超级智能”上。

    从这个意义上讲,SSI 真的是一家典型的“研究时代公司(age-of-research company)”:我们的主业就是做研究,并把研究推到极限。

    11.2 联合创始人出走 Meta:那场收购风波的前后

    Dwarkesh

    外界有一个非常八卦,也很现实的问题:“如果 SSI 已经取得很多突破,为什么你的联合创始人会离开,去 Meta 做高层?”

    很多人把这当作:“看来没什么突破吧”的间接证据。你怎么回应?

    Ilya

    我只做一点事实澄清:

    1. 当时 SSI 正在以大约 320 亿美元估值进行融资。
    2. 在这个过程中,Meta 提出过收购要约。
    3. 我对这个收购的态度是:拒绝。
    4. 我的前联合创始人,对这个收购持赞同态度。
    5. 收购谈不拢之后,他选择加入 Meta,同时获得了相当可观的近期变现。
    6. 只有他一人 从 SSI 去了 Meta。

    从这组事实里,你可以自己得出一个更完整的故事。对我来说,这件事的结论很简单:SSI 继续作为一个独立、以研究为中心的公司存在。

    11.3 最终的策略会趋同:对齐目标上的“合流”

    Dwarkesh

    假设你的技术路径是对的,SSI 也成功站到了前沿。但这并不意味着其他实验室就会自动消失。

    在你眼里,未来这些实验室会怎样相互影响?会不会出现一种“对齐与技术路线上的合流”?

    Ilya

    我其实相信,会有一种渐进合流的过程:

    • 在技术层面:
      • 如果某条路线真的被证明在泛化、学习效率、安全性上都更好,
      • 其他公司迟早会部分采用类似的思想;
      • 就像大家都用 transformer、都用某些类似的 RL 配方一样。
    • 在对齐目标层面:
      • 我认为所有真正面对超级智能的团队,
      • 在认真想清楚之后都会得出类似结论:“我们需要一个关心人类、关心感知生命、具备一定民主性与稳健性的智能体系。”

    在这个 sense 上,我们也许会从“技术竞争”走向“目标共识 + 技术多样性”的局面。

    💭 旁白:合流并不意味着“一个模型统治世界”

    Ilya 描绘的是一种:

    • 目标层面趋同(都想要安全、关怀、民主性的超级智能);
    • 技术实现层面保留差异(不同实验室有不同风格与专长);
    • 在极端风险与关键决策上,有一定程度的合作(联合评估、安全协议等)。

    这比较像一个多极但有基本共识的国际体系,而不是“唯一神脑 + 无数弱小追随者”。

    第十二幕

    时间表、停滞与“别人做出来你会知道的” (01:22:14 – 01:28:41)

    12.1 5–20 年:通向“人类水平学习者”的时间窗口

    Dwarkesh

    你对那种“像人一样学习,甚至更强”的系统——也就是你心中的超级智能——给出的时间预测是什么?

    Ilya

    大概 5 到 20 年。

    这不是一种“筛选后精准到个位数”的预测,而是一种“在可想象的技术发展速度下,我认为合理的时间窗口”。

    12.2 “停滞”到底长什么样?

    Dwarkesh

    你之前说过:现有范式可能会在某个点“停滞”。

    这个“停滞”在实际世界里会表现成什么?是技术完全不再进步吗?

    Ilya

    我所谓的“停滞”大概是这样一种状态:

    • 模型仍然会变好;
    • 应用仍然会扩张;
    • 公司仍然会赚到 非常可观的收入——甚至达到“每年几千亿美金”的级别;
    • 但在某些关键维度上,你会发现它就是“过不去那道坎”:
      • 泛化仍然不如人;
      • 持续学习仍然脆弱;
      • 对齐仍然很难摆脱“脆弱的 reward hacking”。

    换句话说:“停滞”不是“什么都不长”,而是技术曲线在错误的指标上继续上升,而在关键指标上卡住不动。

    12.3 当某个实验室先做出来:信息会以“存在性证明”形式传播

    Dwarkesh

    如果有一天,你们或者别的实验室真的做出了那种“人类水平学习者”,其他公司会立刻知道“如何复现”吗?还是说他们只会感知到:“有种新东西出现了,但我们暂时不知道怎么做。”

    Ilya

    我觉得更可能是后者。

    一旦有实验室在一个明显可见的任务上,展示出“完全不同级别的学习与泛化能力”,整个行业都会知道:“这个空间里存在某种不同的算法。”

    这本身就是一种非常强的信号。其他团队会疯狂去猜:

    • 它用了什么架构?
    • 什么训练范式?
    • 什么样的价值函数或持续学习机制?

    就像当年 transformer 出来后,

    • 不是所有人一夜之间就完全理解了它的潜力;
    • 而是随着时间推移,越来越多实验表明:

    “哦,它在很多地方就是比 RNN、CNN 更有前途。”

    💭 旁白:存在性证明 > 技术细节泄露

    在研究史上,最重要的信息往往不是“怎么做”,而是“这件事可以被做到”。

    • 一旦有人证明了 “X 是可行的”,
    • 那么世界上所有聪明人就会开始围绕 X 去发明、改造、近似、逆向工程。

    Ilya 在这里暗示:“谁先做出超级学习者”,重要但不是唯一关键;真正决定未来结构的是:“这个东西出现时,世界选择如何应对”。

    第十三幕

    自我改进、百万 Ilya 与“多样性从何而来?” (01:28:41 – 01:32:42)

    13.1 “复制一百万个我”真的有意义吗?

    Dwarkesh

    有一种流行的“智能爆炸”想象是这样的:“我们有一百万个 Ilya 在同一个集群里做研究。”

    你会怎么评价这种直觉?有没有可能,我们靠简单复制研究者思维,就引发极快的自我改进?

    Ilya

    我直觉上不太相信“复制同一个人许多份”会带来线性收益。

    • 研究进步的关键,在于思维方式的多样性,
    • 而不是“同一种思路的并行放大”。

    如果真有一个系统能把我复制一百万份,

    • 它可能在“把我这条路径走到极致”上很强;
    • 但很多关键突破,往往来自完全不同的偏见与直觉。

    13.2 为什么今天 LLM 看起来都那么像?

    Dwarkesh

    现实里现在已经有很多家实验室,各自训练自己的 LLM。即便他们宣称数据、训练细节完全不同,但从使用体验来看,这些模型却惊人地相似。

    这是为什么?

    Ilya

    最主要的原因是:预训练(pre-training)的数据分布高度重叠。

    • 你爬取的互联网文本,
    • 你从代码仓库、书籍、论坛得到的东西,大体上就是那一片语料海洋。

    在这样的 distribution 上做 pre-training,

    • 即便架构、超参略有差异,
    • 最终学到的“语言世界模型”会非常相似。

    真正开始产生差异的地方,是 RL 与后训练(post-training):

    • 不同团队设计不同的 RL 环境;
    • 不同的 reward 模型、对齐目标;
    • 在“如何作为 agent 行动”这部分,才渐渐拉开了“性格上的差距”。

    13.3 自博弈 (self-play) 的位置:从 AlphaGo 到 debate、prover-verifier

    Dwarkesh

    你以前在谈 self-play 的时候,给了很多人很大想象空间:

    • 用 self-play 作为“纯 compute 产数据”的方式,
    • 甚至不再依赖现有预训练数据。

    但为什么到现在,似乎还没有特别令人信服的 “self-play LLM 提升方案”被公开?

    Ilya

    我会这么总结:

    1. Self-play 的原始形式比较窄:
    • 像 AlphaGo、OpenAI Five 那样,
    • 它非常适合用于训练“对抗性策略、博弈、谈判、冲突处理”等能力。
    • 这些能力很重要,但毕竟只是智能的一部分。
  • 更广义的“多 agent 对抗”其实已经出现了:
    • 比如 debate(辩论式对齐);
    • prover–verifier(证明者–验证者)结构;
    • LLM-as-a-Judge,对另一个 LLM 的输出进行打分、找错。

    在我看来,这些都是 self-play 思想的延伸:不是两个 agent 在棋盘上下棋,而是在论证空间里竞争、互相找漏洞。

    1. 多 agent 系统天然会激发“差异化”:
    • 如果你把多个 agent 抛进一个复杂任务,
    • 并让它们彼此可见对方正在做什么,
    • 那么理性的策略就是:“不要做别人已经在做的事情。”
    • 这会推动它们自发走向不同的探索方向。

    💭 旁白:从“单智能体最优”到“多智能体生态”

    这段话背后有一层重要的 paradigm shift:真正在复杂世界中起作用的智能,很可能总是多智能体的。

    • 你不再追求一个“完美的单一大脑”;
    • 而是构建一个“相互博弈又相互补充的智能生态”;
    • 其中 diversity 不再只是“训练时随机采样的温度差异”,而是在系统层面被激励出来的行为多样性。

    第十四幕

    研究品味——美感、简洁与“顶层信念”的力量 (01:32:42 – 结束)

    14.1 什么是“研究品味”?

    Dwarkesh

    最后一个问题:“研究品味(research taste)是什么?”

    你几乎参与了深度学习史上多个“节点级事件”:

    • AlexNet、
    • 序列建模、
    • GPT 系列…

    外界对你的标签之一就是“研究品味极好的人”。你自己会怎么定义它?

    Ilya

    我只能从自己的经验讲,别人可能不一样。对我来说,研究品味大概是:

    1. 有一套关于“智能应该长什么样”的美学直觉。
    • 这个美学很大程度上来自对大脑的观察;
    • 但必须是“正确地”理解大脑,而不是类比过度。
  • 同时兼顾几个维度的“美”:
    • 结构上的简洁: 像人工神经元(artificial neuron)这种设计,直觉上就很对:“大脑有很多 neuron,我们也搞很多 neuron;它们从经验中调节连接权重。”
    • 经验上的一致: 大脑从经验中学习,好的 AI 也应该从经验中学习,而不是写死规则。
    • 数理上的优雅: 真正好的方法,通常有一种“数学上站得住”但又不过度复杂的味道。
  • 对“丑陋”的排斥:
    • 如果一个方案需要堆很多 ad-hoc 的 hack、case-by-case 的规则,
    • 我会本能地觉得“哪里不对劲”。

    14.2 顶层信念:当实验说“不”,你要不要继续?

    Ilya

    还有一个非常关键的点是:顶层信念(top-down belief)。

    • 在做新东西时,你几乎必然会遇到很多实验失败;
    • 你不可能一开始就把所有 bug、所有坑都预见到;
    • 数据会一次次告诉你:“这条路走不通”。

    如果你完全“唯数据论”,实验失败几次,你就会 conclude:“OK,这方向是错的。”

    但我经历的一些工作,是这样诞生的:

    1. 先有一个非常强的 top-down 信念:“世界大致必须是这个样子。”
    2. 然后在一串失败的实验面前,坚持:“问题一定出在实现或细节上,而不是在整体方向上。”
    3. 不断 debugging,直到找到那个“把一切拉偏的 bug”。

    研究品味的一部分,就是分辨:“什么时候应该相信直觉顶层结构,什么时候该老老实实承认自己想错了。”

    Dwarkesh

    也就是说,“品味”既是你选择问题、判断美感的能力,也是你在黑暗中决定“继续挖还是换地方挖”的指南针。

    Ilya

    可以这么说。当你确信“智能应该是这样被构造的”,你就会有足够的耐心,去穿越一段“所有实验都在骂你”的时期。

    尾声:一场仍在进行中的思想实验

    Ilya(结尾)

    谢谢,这次聊天我也很享受。

    Dwarkesh

    我也是。我觉得我们其实在做一件很奇特的事——一边用现有的模型和世界对话,一边在想象那些还不存在的智能形态。

    Ilya

    是啊,而且很可能:那些形态会比我们现在能想象的,还要再远很多。

    结语

    当我们顺着这场对话一路走到终点,最让人不安的也许不是“超级智能会不会出现”,而是一个更尖锐的问题:当真正更聪明的心智诞生时,人类究竟还想成为什么? Ilya 一边拆解模型的锯齿能力、预训练的局限和人类惊人的泛化,一边又坦然承认:我们连“进化是如何把价值、情绪和社交欲望刻进大脑”的机制都还没弄懂,却已经在试图复制、放大,甚至超越它。我们口头上谈“对齐”“安全”“管控”,但他给出的几条可能路径——关怀一切感知生命、渐进部署、甚至最终走向 “Neuralink++ 式的人机共生”——无一不是在提醒我们:未来真正需要被设计的,可能不是某个完美的算法,而是整个人类文明愿意以什么样的形式继续存在。也许所谓“研究时代的回归”,不只是回到更艰难、更依赖洞察和品味的科学工作方式,而是被迫重新发明一个问题:在即将到来的超级智能面前,我们能否不再只把自己当作用户、管理者或受益者,而是作为一种仍在学习、仍在改变、仍在承担责任的“共同参与者”?这个问题没人替我们回答——它既不是模型的 loss function,也不是某个 safety 协议的脚注,而是这一代人必须亲手写下的“人类打算怎样与自己的发明共同生活”的长句...

    References

    [1]

    Ilya Sutskever – We're moving from the age of scaling to the age of research:https://youtu.be/aR20FWCCjAs?si=IyHee59_5V8LQMZm