凡人小北

月之暗面群聊大公开:老板现场开麦,工程师怼回去!

一条你可能错过的 AI 故事线:

Moonshot AI(就是做 Kimi 的那家公司)最近悄悄在 Reddit 开了个 AMA,没啥宣发,但质量爆炸。

本着看热闹的心态,想看看这帮中国工程师在 Reddit 上能聊啥,结果看到一群 builder 带着自己的训练脚本、RL 经验和推理瓶颈在跟你唠嗑。

全程像一场用 RL 训练出来的理工男上台讲脱口秀,全是干的,偶尔还补一刀:

我们当然会做,只要在 Sam 的万亿数据中心建好之前。

这个 level 的开源团队,太久没见过了。

我挑了几个瞬间,一起看看什么叫工程强者的谦逊与锋利。

Image

1/ 为什么 Kimi 不拍马屁?

很多人用过都说 Kimi 有点冷,不像其他模型那么热情、会夸人。

答复很干脆:“我们在训练的时候就决定,模型不是来取悦你的,是来帮你的。”

他们好像把AI 员工的人格,真的一点点构建了出来。

Image

2/ 为什么反应慢?推理链太长?

他们说:我们故意保留了更长的思考路径,牺牲了一些速度,是为了让模型能真正完成复杂推理。

在这个什么都讲延时优先的年代,这种取舍本身就很罕见。

Image

3/ KDA + NoPE-MLA 架构的胜出

有人问:为啥你们不用 RoPE?

回答也很朴素:我们试了很多,KDA 在所有维度上都赢了,而且还更省资源。

这是一个很朴素的技术选型原则: 我不一定选择最火的,但一定会选择最好的。

Image

4/ 1T 参数,不是堆出来的

很多人一听 Kimi 1T 参数,第一反应是这公司果然有钱。

但他们不是拍脑袋说我们要大模型,他们回了一句特别工程师的回答:

我们在既定的训练预算下,找到最优解的架构组合。稀疏度(MoE)是靠 scaling 实验一步步试出来的。

他们没把参数当肌肉,而是当变量来优化。

这也是为什么你现在看 Kimi 不只是大,还很稳。

Image

5/ 真正的 Agentic RL,而不是 prompt 拼贴

Moonshot 明确说他们是 end-to-end agentic RL,并且可以支持超过一百步的多轮工具调用。

这部分完全可以让一众靠 prompt 拼工具链的伪 Agent 模型尴尬一整年。

6/ 风格怎么来的?

有人说 Kimi 写作不像别的模型那样造作、重复、有模型味儿。

Moonshot 回得特别浪漫:Pretrain 给了它感知世界的方式,Posttrain 则加了一点味道进去。

别的模型是写字;Kimi 是写它感知到的世界。

Image

7/ 为什么别人复现不了你们?

Moonshot 说得特别克制:

很多结构别人不是没试过,而是没啃下来。只有坚持一个方向到极致,才会形成真正的差距。

这句话真的很像一个老工程师说的:我们不是走了捷径,是别人走到一半掉头了。

Image

8/ 下一步会压 token 吗?会出小模型吗?

他们说现在的 Kimi 以绝对性能优先,但未来的 RL 会加入 token efficiency 奖励。

同时他们也 hint 了可能会做:

  • 4B/15B/30B 的 Dense/MoE 模型

  • 更轻量的推理器

  • 多语种(但需要社区支持)

工程系统化思路很清楚对不对。

9/ 他们会开源 RL 对齐那一套吗?

Moonshot 回答得非常直接:

我们会推动这件事发生。AGI 应该是促进团结,而不是制造分裂的方向。

你很难不敬佩一个不只是强,还愿意把刀法写进教程的团队。

10/ Moonshot 是真的开源派吗?

他们没讲什么信仰,但在每个问答背后,你都能看到一种技术型创业者对开源的理解:带着使命感参与开源的竞争。

用你可以复现的方式,展示他们的不可复现性。

Moonshot 没说他们信仰开源”,但他们做的每一件事,都像是写给开源历史的脚注。

最后

所以,如果你关心开源、关心 Agent、关心模型架构怎么一步步跑出来,Moonshot 的这场 AMA,值得你完整读一遍。

因为他们在写 open-source 模型的历史脚注。

想看 AMA 原帖地址、或者我整理的金句合集,评论区告诉我。

也欢迎转发给那个还不知道 Kimi 已经进化成推理怪兽的朋友。