Kimi连换三个LLM基础组件,全跑通了
今天看了杨植麟在 GTC 2026 的演讲,同时也结合去看了演讲提到的 Kimi 团队近期发布的 Attention Residuals 和 Kimi Linear 两篇论文。
大部分读者可能对 LLM 内部优化(包括一些术语)比较陌生,不过通过这类创始人或技术负责人在关键节点的公开分享,我们也可以高效地了解行业发展的核心动态。
这次演讲视频中,印象比较深的不是某个单点技术,而是 Kimi 在很多方面从构想到大规模落地的完整路径都走通了。杨植麟用 Agent 语言把三个 scaling 维度统一起来,token 效率是更强的先验,长上下文是更久运行的 Agent,Swarm 是并行 Agent。
这不是事后包装,做过 Agent 系统的人能感觉到,这个抽象背后是对领域的深入洞察和理解,三个维度相乘的框架确实有解释力。
Kimi 应该是少有的押注 Muon 这条线路的厂商,让人佩服其创新的勇气。Adam 用了 12 年,已经非常成熟稳定,因此要在万亿参数尺度上押注一个二阶优化器,并进一步通过 QK-Clip / MuonClip 把它稳定扩展到大规模训练,从理论验证到分布式实现,每一步都可能失败。最终 clipping 前后训练曲线严格重叠,这个验证干净得让人舒服。
Kimi Linear 里 KDA 与 global MLA 的 3:1 混合是个务实的工程选择,但背后的路径更值得关注。逐通道对角矩阵衰减的想法并不复杂,但要从这个构想走到百万 token 场景下 6 倍解码吞吐、75% KV cache 节省,中间可能要踩的坑远比论文呈现的多。能在大规模环境中真正跑通,这件事本身就是最大的贡献。
Youtube视频后面也有人戏称 Cursor 开发团队正在集体观看学习,估计是调侃最近 Cursor 团队最近的推出 Composer 2 模型,其基础源于 Kimi-k2.5。
PS:演讲中提到在 Kimi 三个被替换的 LLM 基础组件:
1. Adam 优化器(2014)→ Muon / MuonClip — ~2x token 效率
2. Full Attention(2017)→ Kimi Linear (KDA) — 6x 解码吞吐,75% KV cache 节省
3. Residual Connection(2015)→ Attention Residuals (Block AttnRes) — +24% token 效率
完整视频可以在 Google 搜索 How We Scaled Kimi K2.5
#杨植麟 #KimiK2.5 #GTC2026 #大模型训练 #开源模型 #线性注意力 #AgentSwarm #AI论文解读