Karpathy说还没把Attention is All You Need理解透
上一篇文章写了杨植麟的三条科研原则。其中第一条——"真正有生命力的技术往往足够简单"——我举了三个例子:MuonClip 替代 Adam、Kimi Linear 替代 Full Attention、Attention Residuals 替代固定残差。
有个朋友看完问我:Karpathy 那句"还没把 Attention is All You Need 理解透"到底在说什么?
这篇文章就是回答。
● ● ●
一个十年没人碰的问题
先说背景。
2015 年,ResNet 提出了残差连接。做法很简单:每层网络的输出,加上前一层的输出,传给下一层。
Layer 1 输出 → Layer 2 加上自己 → Layer 3 加上自己 → ...这个设计让几百层的深度网络成为可能。十年里,所有的 Transformer 模型都这么干。没人碰过它。
不是因为它完美。是因为它"够用"。
但够用和正确是两回事。
● ● ●
LSTM 转 90 度
Ilya Sutskever 做过一个观察,杨植麟在 GTC 演讲里引用了它:
"残差连接就是旋转 90 度的 LSTM——同一种重发放机制,只是方向不同。"
画个网格就清楚了。横轴是 token,纵轴是 layer。
LSTM 在横轴上从左往右移动:token 1 → token 2 → token 3,每步只看前一步。
残差连接在纵轴上从下往上移动:Layer 1 → Layer 2 → Layer 3,每层只看前一层。
同一种结构。同一个局限——只能看"上一步"。
时间维度和深度维度的升级对比
时间维度的问题,2017 年的 Transformer 已经解决了。Self-Attention 让任何 token 可以直接看任何之前的 token,不再需要一步一步传。
但深度维度一直停留在 2015 年。
十年。整整十年。
● ● ●
旋转 90 度
2026 年 3 月 16 日,Kimi 在 arXiv 贴了一篇论文:Attention Residuals。
做法简单到让你想说"为什么没人做过":
把残差连接里的固定加法,换成 Softmax 注意力。
Layer 20 不再被动接收前面 19 层均匀搅拌后的结果。它可以根据自己当前的需求,选择性地关注 Layer 3 的低级特征、Layer 15 的中级模式,或者同时关注它们。
每一层多了一个学出来的"查询向量"——很小,不依赖输入 token,几乎不增加计算量。
为了避免显存爆炸(几百层每层都看前面所有层),他们做了个工程优化叫 Block AttnRes:把层分成几个块,块内标准残差,块间做深度注意力。开销不到 2%。
当天,三件事接连发生。
Elon Musk 转发论文:"Impressive work from Kimi"。
Jerry Tworek,前 OpenAI 联合创始人,评论只有三个词:"deep learning 2.0"。
然后是 Andrej Karpathy:
"We haven't really taken the title 'Attention is All You Need' seriously."
● ● ●
为什么是 "deep learning 2.0"
这三个人的反应放在一起,逻辑是清晰的。
Musk 看到了一个中国团队在干美国实验室没干的事。
Tworek 看到了这不仅仅是"改进残差连接"——这是把深度学习架构设计的最后一处固定组件,变成了可学习的动态机制。2017 年的 Transformer 论文标题"Attention is All You Need",在过去九年里只是一个隐喻。Kimi 把它变成了字面意义上的事实。
Karpathy 看到了最多。
他看到的不是一篇论文。是一个模式。
● ● ●
三次动刀
把 Kimi 的技术路线放在一起看:
- 01
MuonClip 替代 Adam(2014 年成为标配的优化器) - 02
Kimi Linear 替代 Full Attention(2017 年 Transformer 定义的全注意力) - 03
Attention Residuals 替代固定残差(2015 年 ResNet 定义的基础构件)
三个目标,分别用了 8、9、10 年。三样东西的共同点:所有人都认为是"标准",没人觉得值得动。
Karpathy 那句"还没把 Attention is All You Need 理解透",不是针对残差连接。是针对整个行业面对这些"标配"时的惯性。
2017 年的论文标题是一个承诺:Attention 可以替代一切固定机制。这个承诺在时间维度兑现了,在深度维度沉睡了十年。Kimi 把它叫醒了。
● ● ●
1.25× 意味着什么
论文里的硬数据:
同等算力下,Block AttnRes 比标准残差效率高 1.25 倍。
看绝对值不大。但注意两件事。
第一,开销不到 2%。白送的 25%。
第二,Scaling 指数更陡。标准残差的 loss 随算力以 C^(-0.057) 下降,AttnRes 以 C^(-0.058) 下降。模型越大,差距越大。万亿参数级别训练,1.25 倍就是几千万美元。
这还没算下游任务的提升。在 GPQA-Diamond 科学推理上,AttnRes 比基线高了 7.5 分。多步推理任务全面受益——恰好验证了"能跨层选择信息"的核心假设。
● ● ●
为什么是 Kimi 做到的
这个问题值得单独说。
核心想法不复杂。残差=旋转 LSTM,注意力可替代残差——任何上过深度学习课的人都能理解这个类比。
但十年没人做。
杨植麟在 GTC 演讲里给了一个解释:
"过去十年的研究范式是发论文,别人信不信随意。现在的范式是发论文加规模化验证,结论扎实到没人能反驳。"
十年前的小模型,验证不了这种改动的 Scaling 效应。波动太大,区分不了 noise 和真实提升。
只有在万亿参数、百万美元级别的训练跑中,才能看到那条更陡的曲线。
这也是为什么 Karpathy、Tworek、Musk 同时注意到这篇论文。不是想法有多新——是验证有多硬。
● ● ●
回到三条原则
杨植麟说第一条原则是"技术往往足够简单"。
Attention Residuals 就是最干净的证明。不需要新框架,不需要重新定义范式。你只需要理解两个东西:残差连接在做什么,Attention 在做什么。然后问一个问题:
为什么 Attention 只在时间维度生效?
这就是"真简单"和"简陋"的区别。简陋是没想过。真简单是想透了之后,用最少的东西做到最对的事。
Karpathy 说"还没理解透"。
杨植麟大概理解了。而且是那种"十年没人碰的东西,我用 2% 的开销给你一个 25% 提升"的理解。