月之暗面群聊大公开:老板现场开麦,工程师怼回去!
一条你可能错过的 AI 故事线:
Moonshot AI(就是做 Kimi 的那家公司)最近悄悄在 Reddit 开了个 AMA,没啥宣发,但质量爆炸。
本着看热闹的心态,想看看这帮中国工程师在 Reddit 上能聊啥,结果看到一群 builder 带着自己的训练脚本、RL 经验和推理瓶颈在跟你唠嗑。
全程像一场用 RL 训练出来的理工男上台讲脱口秀,全是干的,偶尔还补一刀:
我们当然会做,只要在 Sam 的万亿数据中心建好之前。
这个 level 的开源团队,太久没见过了。
我挑了几个瞬间,一起看看什么叫工程强者的谦逊与锋利。
1/ 为什么 Kimi 不拍马屁?
很多人用过都说 Kimi 有点冷,不像其他模型那么热情、会夸人。
答复很干脆:“我们在训练的时候就决定,模型不是来取悦你的,是来帮你的。”
他们好像把AI 员工的人格,真的一点点构建了出来。
2/ 为什么反应慢?推理链太长?
他们说:我们故意保留了更长的思考路径,牺牲了一些速度,是为了让模型能真正完成复杂推理。
在这个什么都讲延时优先的年代,这种取舍本身就很罕见。
3/ KDA + NoPE-MLA 架构的胜出
有人问:为啥你们不用 RoPE?
回答也很朴素:我们试了很多,KDA 在所有维度上都赢了,而且还更省资源。
这是一个很朴素的技术选型原则: 我不一定选择最火的,但一定会选择最好的。
4/ 1T 参数,不是堆出来的
很多人一听 Kimi 1T 参数,第一反应是这公司果然有钱。
但他们不是拍脑袋说我们要大模型,他们回了一句特别工程师的回答:
我们在既定的训练预算下,找到最优解的架构组合。稀疏度(MoE)是靠 scaling 实验一步步试出来的。
他们没把参数当肌肉,而是当变量来优化。
这也是为什么你现在看 Kimi 不只是大,还很稳。
5/ 真正的 Agentic RL,而不是 prompt 拼贴
Moonshot 明确说他们是 end-to-end agentic RL,并且可以支持超过一百步的多轮工具调用。
这部分完全可以让一众靠 prompt 拼工具链的伪 Agent 模型尴尬一整年。
6/ 风格怎么来的?
有人说 Kimi 写作不像别的模型那样造作、重复、有模型味儿。
Moonshot 回得特别浪漫:Pretrain 给了它感知世界的方式,Posttrain 则加了一点味道进去。
别的模型是写字;Kimi 是写它感知到的世界。
7/ 为什么别人复现不了你们?
Moonshot 说得特别克制:
很多结构别人不是没试过,而是没啃下来。只有坚持一个方向到极致,才会形成真正的差距。
这句话真的很像一个老工程师说的:我们不是走了捷径,是别人走到一半掉头了。
8/ 下一步会压 token 吗?会出小模型吗?
他们说现在的 Kimi 以绝对性能优先,但未来的 RL 会加入 token efficiency 奖励。
同时他们也 hint 了可能会做:
4B/15B/30B 的 Dense/MoE 模型
更轻量的推理器
多语种(但需要社区支持)
工程系统化思路很清楚对不对。
9/ 他们会开源 RL 对齐那一套吗?
Moonshot 回答得非常直接:
我们会推动这件事发生。AGI 应该是促进团结,而不是制造分裂的方向。
你很难不敬佩一个不只是强,还愿意把刀法写进教程的团队。
10/ Moonshot 是真的开源派吗?
他们没讲什么信仰,但在每个问答背后,你都能看到一种技术型创业者对开源的理解:带着使命感参与开源的竞争。
用你可以复现的方式,展示他们的不可复现性。
Moonshot 没说他们信仰开源”,但他们做的每一件事,都像是写给开源历史的脚注。
最后
所以,如果你关心开源、关心 Agent、关心模型架构怎么一步步跑出来,Moonshot 的这场 AMA,值得你完整读一遍。
因为他们在写 open-source 模型的历史脚注。
想看 AMA 原帖地址、或者我整理的金句合集,评论区告诉我。
也欢迎转发给那个还不知道 Kimi 已经进化成推理怪兽的朋友。