深夜重磅!Kimi K3全面开源,中国大模型叩开全球顶尖AI之门
接近全球顶尖水平的中国开源模型 根据官方披露的资料, Kimi K3 在编程、代理 Agent 等方面表现优异。尤其在长周期工程任务方面,能在极少监督下持续完成多步骤任务、处理大型代码库,并协调终端工具。此前还展示了将编程与视觉推理相结合的优异表现,可以利用截图和视觉反馈来迭代游戏开发、前端开发或 CAD 任务。 在基准测试中,虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol ,但却展现出了前沿水平能力,并稳定超过了其他所有模型。
Kimi K3何以如此强大? Kimi K3 因其性能媲美西方顶尖闭源模型而备受科技圈瞩目,但是推出不到一周便卷入了美国政客引发的“蒸馏”风波之中。 美国白宫科技政策办公室主任迈克尔 ·克拉齐奥斯 7 月 22 日 突然在社交媒体上宣称月之暗面通过蒸馏美国 Anthropic 公司的 Fable 开发 Kimi K3 大模型。 海外不少有识之士站出来为 Kimi K3 发声。 有科技博主在 X 发文指出,如果 Kimi K3 仅是 Fable 5 的蒸馏产物,其性能理应只是接近后者。但评测结果显示, Kimi K3 在部分领域优于 Fable 5 ,这种 超越 表现难以单凭蒸馏技术实现。 也有专家指出, Fable 5 上线仅 72 小时便被迫全球下架,到 7 月 1 日才重新开放,而 Kimi K3 在 7 月中旬发布,短短两周时间根本没法提取这么多数据进行整合,认为“蒸馏”一说站不住脚。 针对网传 Kimi K3 是“蒸馏”其他模型的猜测,月之暗面企业业务负责人黄震昕明确予以否认,黄震昕表示, Kimi K3 性能实现跨越式提升,核心依托底层原创架构创新,并非对任何现有模型进行蒸馏复刻。 随着此次开源, Kimi K3 也上线了技术报告,披露了更多技术细节,可以看到,架构创新,再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力,带来性能跃升。 · KDA + AttnRes :以 3:1 比例混合 KDA 与 Gated MLA ,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动。 · Stable LatentMoE :每个 token 从 896 个路由专家中激活 16 个,并通过 SiTU-GLU 与 Quantile Balancing 保持极高稀疏度下的训练稳定。 · MoonViT-V2 :视觉编码器从零开始使用 next-token prediction 训练,无需对比预训练,在达到 SigLIP 初始化基线效果的同时获得更稳定的优化过程。 ·后训练与评估 :在通用推理、通用 Agent 和编程 Agent 三大领域进行大规模任务合成,百万 token 上下文的强化学习基建,近 20 个内部评测集的完整评估结果。 强大的模 型能力 需要 Infra 基础设施层的稳定支撑 , MoonEP 、 FlashKDA 和 AgentEnv 是 支撑 Kimi K3 训练的三项 Infra 技术,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路 , 具体如下: · MoonEP : MoonEP 是为超大的细粒度 MoE 打造的高性能通信库,让专家并行( expert-parallel )的通信在不均衡的情况下仍然实现极致效率。 · FlashKDA : FlashKDA 是实现的 Kimi Delta Attention 高性能算子( kernel )。在英伟达 H20 上,相比 flash-linear-attention 基线, 其 prefill 速度提升 1.72-2.22 倍,可以直接作为 flash-linear-attention 的替换后端。 · AgentEnv : AgentENV 是 Agent 沙箱系统,用于大规模运行 Agent 环境 , 它为 Kimi K3 的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉( fork )等,可以应对大规模并行的 Agent 工作流与训练任务。 这三项技术是支撑 Kimi K3 训练效率与稳定性的关键 , 其中 FlashKDA 此前已开源, MoonEP 和 AgentEnv 则随本次发布正式开源。 月之暗面没有藏着这些关键技术,全部开源出来,显示了其开源开放的诚意。
小结:开源与闭源之外不要忽略AI安全治理问题 当 Kimi K3 的模型权重向全球开发者敞开下载,一条清晰的技术路线分野已然浮现:大洋彼岸的顶尖模型依然紧锁于少数巨头的服务器之后,而以月之暗面为代表的中国 AI 力量,正将最前沿的成果以开源开放之姿推向世界。 正如 研究中国 AI 治理的 MATS Research 研究员洛克 所言 : “开源一直是中国 AI 战略的重中之重。这不仅是国内的技术扩散路径,更是核心的赶超战略。” “ 我们坚信开放权重模型的价值。它们能降低获取智能的门槛,推动创新,并赋予用户对数据更大的控制权、隐私保护和所有权。 ”月之暗面在 Kimi K3 开源公告中指出, “ 我们相信,对于 AGI 这样具有深远影响的技术,一个广泛、开放的生态系统是最适合承载它的土壤。为此,我们将继续贡献自己的力量。 ”这份信念正获得更广泛的行业共鸣,英伟达黄仁勋近日牵头拥护开源模型的发展,也印证了开源已是全球 AI 发展的主流趋势。 当然,开源与闭源从来不是非此即彼的优劣之争,更多是不同商业逻辑与生态愿景下的策略选择。但当模型能力日益逼近人类智能的边界,一个更紧迫的命题摆在所有参与者面前:无论是开放的社区还是封闭的实验室,前沿 AI 在核武器、生物工程等敏感领域的安全治理,都不应被任何叙事所遮蔽。技术可以有不同的开放尺度,但对安全的敬畏、对责任的担当,必须成为全球 AI 共同体不可退让的共识。这条路,才刚刚开始,但方向,已然清晰。
-
以为能躺赚,结果“养虾”变成了“养雷”,第一批“养虾人”已经失眠了……
-
DeepSeek被针对,Anthropic指控三家中国AI蒸馏剽窃,马斯克硬刚“贼喊抓贼”!
-
明明大厂裁员滚滚,为什么运维还这么难招?
-
在 SQL 中写了 in 和 not in,技术总监让我明天不用来了
-
年底了!系统稳如狗,甲方觉得我们没工作量,怎么收运维费?
-
为什么DeepSeek火之后,人们想到的是大量裁员,而不是实行上三休四?
-
《AI数据分析之ChatBI发展与应用实践》白皮书(附下载)正式上线啦
-
号外!《核心系统分布式数据库选型指南》电子书(附下载)正式上线
-
解锁数据架构现代化密码,《实时数仓选型指南》电子书(附下载)正式上线啦