alitrack

Karpathy说还没把Attention is All You Need理解透

上一篇文章写了杨植麟的三条科研原则。其中第一条——"真正有生命力的技术往往足够简单"——我举了三个例子:MuonClip 替代 Adam、Kimi Linear 替代 Full Attention、Attention Residuals 替代固定残差。

有个朋友看完问我:Karpathy 那句"还没把 Attention is All You Need 理解透"到底在说什么?

这篇文章就是回答。

● ● ●

一个十年没人碰的问题

先说背景。

2015 年,ResNet 提出了残差连接。做法很简单:每层网络的输出,加上前一层的输出,传给下一层。

Layer 1 输出 → Layer 2 加上自己 → Layer 3 加上自己 → ...

这个设计让几百层的深度网络成为可能。十年里,所有的 Transformer 模型都这么干。没人碰过它。

不是因为它完美。是因为它"够用"。

但够用和正确是两回事。

● ● ●

LSTM 转 90 度

Ilya Sutskever 做过一个观察,杨植麟在 GTC 演讲里引用了它:

"残差连接就是旋转 90 度的 LSTM——同一种重发放机制,只是方向不同。"

画个网格就清楚了。横轴是 token,纵轴是 layer。

LSTM 在横轴上从左往右移动:token 1 → token 2 → token 3,每步只看前一步。

残差连接在纵轴上从下往上移动:Layer 1 → Layer 2 → Layer 3,每层只看前一层。

同一种结构。同一个局限——只能看"上一步"。

时间维度和深度维度的升级对比

时间维度和深度维度的升级对比

时间维度的问题,2017 年的 Transformer 已经解决了。Self-Attention 让任何 token 可以直接看任何之前的 token,不再需要一步一步传。

但深度维度一直停留在 2015 年。

十年。整整十年。

● ● ●

旋转 90 度

2026 年 3 月 16 日,Kimi 在 arXiv 贴了一篇论文:Attention Residuals。

做法简单到让你想说"为什么没人做过":

把残差连接里的固定加法,换成 Softmax 注意力。

Layer 20 不再被动接收前面 19 层均匀搅拌后的结果。它可以根据自己当前的需求,选择性地关注 Layer 3 的低级特征、Layer 15 的中级模式,或者同时关注它们。

每一层多了一个学出来的"查询向量"——很小,不依赖输入 token,几乎不增加计算量。

为了避免显存爆炸(几百层每层都看前面所有层),他们做了个工程优化叫 Block AttnRes:把层分成几个块,块内标准残差,块间做深度注意力。开销不到 2%。

当天,三件事接连发生。

Elon Musk 转发论文:"Impressive work from Kimi"。

Jerry Tworek,前 OpenAI 联合创始人,评论只有三个词:"deep learning 2.0"。

然后是 Andrej Karpathy:

"We haven't really taken the title 'Attention is All You Need' seriously."

● ● ●

为什么是 "deep learning 2.0"

这三个人的反应放在一起,逻辑是清晰的。

Musk 看到了一个中国团队在干美国实验室没干的事。

Tworek 看到了这不仅仅是"改进残差连接"——这是把深度学习架构设计的最后一处固定组件,变成了可学习的动态机制。2017 年的 Transformer 论文标题"Attention is All You Need",在过去九年里只是一个隐喻。Kimi 把它变成了字面意义上的事实。

Karpathy 看到了最多。

他看到的不是一篇论文。是一个模式。

● ● ●

三次动刀

把 Kimi 的技术路线放在一起看:

  1. 01
    MuonClip 替代 Adam(2014 年成为标配的优化器)
  2. 02
    Kimi Linear 替代 Full Attention(2017 年 Transformer 定义的全注意力)
  3. 03
    Attention Residuals 替代固定残差(2015 年 ResNet 定义的基础构件)

三个目标,分别用了 8、9、10 年。三样东西的共同点:所有人都认为是"标准",没人觉得值得动。

Karpathy 那句"还没把 Attention is All You Need 理解透",不是针对残差连接。是针对整个行业面对这些"标配"时的惯性。

2017 年的论文标题是一个承诺:Attention 可以替代一切固定机制。这个承诺在时间维度兑现了,在深度维度沉睡了十年。Kimi 把它叫醒了。

● ● ●

1.25× 意味着什么

论文里的硬数据:

同等算力下,Block AttnRes 比标准残差效率高 1.25 倍。

看绝对值不大。但注意两件事。

第一,开销不到 2%。白送的 25%。

第二,Scaling 指数更陡。标准残差的 loss 随算力以 C^(-0.057) 下降,AttnRes 以 C^(-0.058) 下降。模型越大,差距越大。万亿参数级别训练,1.25 倍就是几千万美元。

这还没算下游任务的提升。在 GPQA-Diamond 科学推理上,AttnRes 比基线高了 7.5 分。多步推理任务全面受益——恰好验证了"能跨层选择信息"的核心假设。

● ● ●

为什么是 Kimi 做到的

这个问题值得单独说。

核心想法不复杂。残差=旋转 LSTM,注意力可替代残差——任何上过深度学习课的人都能理解这个类比。

但十年没人做。

杨植麟在 GTC 演讲里给了一个解释:

"过去十年的研究范式是发论文,别人信不信随意。现在的范式是发论文加规模化验证,结论扎实到没人能反驳。"

十年前的小模型,验证不了这种改动的 Scaling 效应。波动太大,区分不了 noise 和真实提升。

只有在万亿参数、百万美元级别的训练跑中,才能看到那条更陡的曲线。

这也是为什么 Karpathy、Tworek、Musk 同时注意到这篇论文。不是想法有多新——是验证有多硬。

● ● ●

回到三条原则

杨植麟说第一条原则是"技术往往足够简单"。

Attention Residuals 就是最干净的证明。不需要新框架,不需要重新定义范式。你只需要理解两个东西:残差连接在做什么,Attention 在做什么。然后问一个问题:

为什么 Attention 只在时间维度生效?

这就是"真简单"和"简陋"的区别。简陋是没想过。真简单是想透了之后,用最少的东西做到最对的事。

Karpathy 说"还没理解透"。

杨植麟大概理解了。而且是那种"十年没人碰的东西,我用 2% 的开销给你一个 25% 提升"的理解。