ITPUB

深夜重磅!Kimi K3全面开源,中国大模型叩开全球顶尖AI之门

月之暗面全面 开源Kimi K3! 7 月 2 7 日深夜,月之暗面 发布 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术 MoonEP 、 FlashKDA 和 AgentEnv 。允许全球开发者免费下载、微调并部署该模型,以此加速前沿智能的部署与普及,促进 AGI 研究 ,同时 进一步扩大 AI 用户基础。 Kimi K3 是一个拥有 2.8 万亿参数的混合专家( MoE )模型, 支持 100 万 token 的上下文窗口,是 目前全球规模最大的开放权重模型 , 同时也是 Artificial Analysis 智能指数排名第一的开源模型,获得了 57 分高分,仅次于 Anthropic 和 OpenAI 的前沿闭源模型。




接近全球顶尖水平的中国开源模型 根据官方披露的资料, Kimi K3 在编程、代理 Agent 等方面表现优异。尤其在长周期工程任务方面,能在极少监督下持续完成多步骤任务、处理大型代码库,并协调终端工具。此前还展示了将编程与视觉推理相结合的优异表现,可以利用截图和视觉反馈来迭代游戏开发、前端开发或 CAD 任务。 在基准测试中,虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol ,但却展现出了前沿水平能力,并稳定超过了其他所有模型。
Kimi K3 在编程基准测试 的 几乎所有项目中都表现强劲 , 尤其是 在 Program Bench 和 SWE Marathon 测试中占据领先地位, 拔得头筹。 在 Terminal-Bench 2.1 测试中与 GPT-5.6 Sol 的差距仅半分,并在大多数单项测试中击败了 Opus 4.8 。 不过, Kimi K3 明显落后的领域是 DeepSWE 和 FrontierSWE ,在这两项测试中, Fable 5 和 GPT-5.6 Sol 占据了领先地位。
Kimi K3 在代理 Agent 基准测试中同样表现强劲,尤其是 Automation 、 BrowseComp 和 Spreadsheet 测试中占据领先地位,摘得桂冠。 在大多数单项测试中击败了 Opus 4.8 ,甚至在多项测试中超越了 GPT-5.6 Sol 。但是 Kimi K3 在 GDPval-AA v2 Elo 测试中明显落后于 Fable 5 和 GPT-5.6 Sol 。
此外, Kimi K3 还推动了端到端知识工作的进展。除了公开基准外, Kimi K3 ( max )在其内部评测(基于真实的智能体协作工作流而非公开基准测试)中也展现出稳定提升。 与国际顶尖模型相比, Fable 5 是 Anthropic 性能最强的模型 ,整体智能方面明显领先,但 K3 的卖点并非与 Fable 5 一样好,而是“以极低的价格,已达到 Fable 5 的大部分水平”。 一周前,月之暗面发布了 Kimi K3 ,因其优异的能力受到用户“远超预期”的广泛支持,服务上线 48h 远超算力容量,从而暂停了 C 端新用户订阅。 如今,这样强大的中国模型正式开源,引发广泛关注。 Hugging Face CEO Clem Delangue 发文表示, Kimi K3 30 分钟内以超过 4000 个赞登顶平台 Trending 榜首,创下平台迄今最快的发布增长速度。北美 AI 基础设施创企 OsmanticAI 的创始人兼 CEO Ahmad 更是将 Kimi K3 称为“本地版 Fable 5 ”。 与此同时, Kimi K3 的亮眼表现也触动了海外敏感神经。有海外媒体指出:“ 发展趋势已足够清晰 , 一款开放式中国模型如今已足够接近顶尖水平,无法再将其视为研究玩具而置之不理。 ”




Kimi K3何以如此强大? Kimi K3 因其性能媲美西方顶尖闭源模型而备受科技圈瞩目,但是推出不到一周便卷入了美国政客引发的“蒸馏”风波之中。 美国白宫科技政策办公室主任迈克尔 ·克拉齐奥斯 7 月 22 日 突然在社交媒体上宣称月之暗面通过蒸馏美国 Anthropic 公司的 Fable 开发 Kimi K3 大模型。 海外不少有识之士站出来为 Kimi K3 发声。 有科技博主在 X 发文指出,如果 Kimi K3 仅是 Fable 5 的蒸馏产物,其性能理应只是接近后者。但评测结果显示, Kimi K3 在部分领域优于 Fable 5 ,这种 超越 表现难以单凭蒸馏技术实现。 也有专家指出, Fable 5 上线仅 72 小时便被迫全球下架,到 7 月 1 日才重新开放,而 Kimi K3 在 7 月中旬发布,短短两周时间根本没法提取这么多数据进行整合,认为“蒸馏”一说站不住脚。 针对网传 Kimi K3 是“蒸馏”其他模型的猜测,月之暗面企业业务负责人黄震昕明确予以否认,黄震昕表示, Kimi K3 性能实现跨越式提升,核心依托底层原创架构创新,并非对任何现有模型进行蒸馏复刻。 随着此次开源, Kimi K3 也上线了技术报告,披露了更多技术细节,可以看到,架构创新,再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力,带来性能跃升。 · KDA + AttnRes :以 3:1 比例混合 KDA 与 Gated MLA ,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动。 · Stable LatentMoE :每个 token 从 896 个路由专家中激活 16 个,并通过 SiTU-GLU 与 Quantile Balancing 保持极高稀疏度下的训练稳定。 · MoonViT-V2 :视觉编码器从零开始使用 next-token prediction 训练,无需对比预训练,在达到 SigLIP 初始化基线效果的同时获得更稳定的优化过程。 ·后训练与评估 :在通用推理、通用 Agent 和编程 Agent 三大领域进行大规模任务合成,百万 token 上下文的强化学习基建,近 20 个内部评测集的完整评估结果。 强大的模 型能力 需要 Infra 基础设施层的稳定支撑 , MoonEP 、 FlashKDA 和 AgentEnv 是 支撑 Kimi K3 训练的三项 Infra 技术,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路 , 具体如下: · MoonEP : MoonEP 是为超大的细粒度 MoE 打造的高性能通信库,让专家并行( expert-parallel )的通信在不均衡的情况下仍然实现极致效率。 · FlashKDA : FlashKDA 是实现的 Kimi Delta Attention 高性能算子( kernel )。在英伟达 H20 上,相比 flash-linear-attention 基线, 其 prefill 速度提升 1.72-2.22 倍,可以直接作为 flash-linear-attention 的替换后端。 · AgentEnv : AgentENV 是 Agent 沙箱系统,用于大规模运行 Agent 环境 , 它为 Kimi K3 的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉( fork )等,可以应对大规模并行的 Agent 工作流与训练任务。 这三项技术是支撑 Kimi K3 训练效率与稳定性的关键 , 其中 FlashKDA 此前已开源, MoonEP 和 AgentEnv 则随本次发布正式开源。 月之暗面没有藏着这些关键技术,全部开源出来,显示了其开源开放的诚意。




小结:开源与闭源之外不要忽略AI安全治理问题 当 Kimi K3 的模型权重向全球开发者敞开下载,一条清晰的技术路线分野已然浮现:大洋彼岸的顶尖模型依然紧锁于少数巨头的服务器之后,而以月之暗面为代表的中国 AI 力量,正将最前沿的成果以开源开放之姿推向世界。 正如 研究中国 AI 治理的 MATS Research 研究员洛克 所言 : “开源一直是中国 AI 战略的重中之重。这不仅是国内的技术扩散路径,更是核心的赶超战略。” “ 我们坚信开放权重模型的价值。它们能降低获取智能的门槛,推动创新,并赋予用户对数据更大的控制权、隐私保护和所有权。 ”月之暗面在 Kimi K3 开源公告中指出, “ 我们相信,对于 AGI 这样具有深远影响的技术,一个广泛、开放的生态系统是最适合承载它的土壤。为此,我们将继续贡献自己的力量。 ”这份信念正获得更广泛的行业共鸣,英伟达黄仁勋近日牵头拥护开源模型的发展,也印证了开源已是全球 AI 发展的主流趋势。 当然,开源与闭源从来不是非此即彼的优劣之争,更多是不同商业逻辑与生态愿景下的策略选择。但当模型能力日益逼近人类智能的边界,一个更紧迫的命题摆在所有参与者面前:无论是开放的社区还是封闭的实验室,前沿 AI 在核武器、生物工程等敏感领域的安全治理,都不应被任何叙事所遮蔽。技术可以有不同的开放尺度,但对安全的敬畏、对责任的担当,必须成为全球 AI 共同体不可退让的共识。这条路,才刚刚开始,但方向,已然清晰。