alitrack

不用复杂算法也能做到全球最大——杨植麟的三条科研原则

前段时间面试了一个某 C9 高校读了两年就退学的的博士研究生。

退学的理由是:GPT 出来了,觉得自己的大模型专业没有啥可研究的了。

我当时没说什么。但随着K3 爆红,看了有人在视频号中分享的杨植麟的三条科研原则。我脑子里立刻跳出那个退学的博士研究生。

如果那个退学研究生听过杨植麟的第三条原则——"永远不要认为机会已经耗尽"——也许会做出不同的选择。

我一条一条说。

杨植麟的三条科研原则

杨植麟的三条科研原则

● ● ●

第一条:真正有生命力的技术往往足够简单

K3 发布时大家都在谈 2.8 万亿参数。但真正让我觉得有意思的,是它的三个底层改动。

MuonClip 优化器,替代了用了十年的 Adam。核心逻辑不复杂——Adam 在万亿参数训练时 Token 效率不够,MuonClip 用一个叫 Newton-Schulz 迭代的技巧配合 QK-Clip,实现了 2 倍于 AdamW 的效率。

Kimi Linear 注意力机制。换了种方式思考注意力——不是所有层都需要全注意力。在 100 万 token 的超长上下文中,解码速度提升了 5 到 6 倍。

Attention Residuals。把 2015 年的 ResNet 残差连接思路重新表达了一遍——把固定加法换成 Softmax 聚合。48B 模型上效率提升 1.25 倍。

三个改动都不复杂。但三个都是对着业界"标配"动刀。

Andrej Karpathy 的评价我印象很深:"看来我们还没把'Attention is All You Need'这句话按字面意思理解透。"

十年前的想法,今天的工程能力。简单不是简陋,是直击本质。

● ● ●

第二条:确定长期目标,把大问题逐步拆解

杨植麟有一套很清晰的框架。他把 AI 能力分成五层:

L1 聊天 → L2 推理 → L3 Agent 执行 → L4 创新贡献 → L5 组织多 Agent 协作。

每一层是下一层的基础。

在工程上,这体现为三个维度的同步推进:Token 效率(让有限数据产出更多智能)、长上下文(让模型处理更复杂的任务)、Agent Swarm(让模型突破单线程局限)。

三条线独立迭代,乘起来就是 K3 的效果。

K3 官方博客有一句诚实到让人好感的声明:"K3 整体表现仍落后于 Claude Fable 5 和 GPT 5.6 Sol,仅在某些 coding 和 Agent 任务上展现出竞争力。"

没有吹牛。就是在爬梯子。

● ● ●

第三条:永远不要认为机会已经耗尽

回到那个退学的博士研究生。

GPT 出来后觉得自己没得研究了。但杨植麟面对的是更狠的——2025 年初,Kimi 发布了 K1.5,同日,DeepSeek R1 发布。

K1.5 被完全淹没。用户流失。中文 AI 圈所有人都在讨论 DeepSeek。

如果那时候杨植麟觉得"机会已经耗尽了",就没有后面的故事。

但他做了一件事:停止 C 端营销,全线转向开源和开发者。

然后是一条陡峭的恢复曲线:

  • 2026 年 1 月:K2.5 发布,引入 Agent Swarm
  • 3 月:中关村论坛 + GTC 演讲,完整披露技术路线
  • 7 月 16 日:K3 发布,2.8T 参数,全球最大开源模型
  • 7 月 20 日:估值近 300 亿美元

ARR 从 3 月的 1 亿 → 4 月 2 亿 → 6 月 3 亿美元。

不是直线上升。是被人打了一拳,爬起来换了个方向跑。

● ● ●

这三条放在一起

杨植麟今年 34 岁。清华第一,CMU 博士四年毕业,导师说他 "absolutely brilliant"。

但 K3 的成功不是因为天才。是他把"简单""拆解""不放弃"当作可以执行的工程原则。

MuonClip 替代 Adam,够简单。五层阶梯 × 三个维度,够拆解。被 DeepSeek 截胡后不换赛道换打法,够不放弃。

而那个退学的博士研究生——两年积累的方法论、直觉、工程判断力,在 GPT 时代依然稀缺。只是缺了第三条原则,就提前退场了。

Andrej Karpathy 说"还没把 Attention is All You Need 理解透"。

杨植麟大概是理解得最透的那批人之一——而且他不只是理解论文,他理解怎么在被打倒之后继续爬梯子。