怎么看待“史上最大开源模型” Kimi K3?
一、
这两天,大家都被 Kimi K3[1] 刷屏了吧,到底应该怎么看待这个史上最大开源模型?
我来说说我的看法,分成几点。
首先,它的性能是否真的接近 Fable 5?
根据多个国外机构的测试,以及我自己的测试(附在后文),我认为是真的。
Arena AI 把它列为互联网开发的第一名[2]。注意,这只是比较前端编程,其他方面还是 Fable 5 领先。
独立评测机构 Artificial Analysis 把它列为第三[3]。
其他的几种测试,比如办公能力 GDPval v2[4]、写作能力 Writing Elo[5]、氛围编程 BridgeBench[6]、全栈编程 Next.js[7] 的测试,它都排名前三甲,甚至第一。
我认为,可以确定它自己在发布公告中的定位是可信的,即实力略逊于 Claude Fable 5 和 GPT 5.6 Sol,但是强于 Claude Opus 4.8。
二、
为什么它的能力突然变强了?
它的上一个版本 Kimi K2.7 Code 是6月12日发布的,表现只能说是普通,在 Artificial Analysis 排名中仅仅位列17。
为什么仅仅过去了一个月,就有这样巨幅的提升呢?
比起以前的版本,K3 最大不同就是参数数量从 1T 增加到了 2.8T,这大概就是它能力飞跃的原因。
这个 2.8T 的参数数量是空前的,远远多于其他开源模型,足以跟国外旗舰比肩。
我们知道,参数数量代表了大模型计算 Token 时,所要考虑的因素。参数越多,就表明模型所考虑的因素越多,一般来说,生成的效果就越好。
三、
那么,Kimi 如何减少计算量?
我们知道,参数越多,意味着计算量越大,从而模型的使用成本会大幅上升,响应时间也会变长。
所以,真正困难的不是增加参数,那只要为方程式拟合更多变量就行了,而是如何控制计算量,不让它随着参数数量增长而爆炸。
Kimi K3 为了减少计算量,充分利用了“专家混合模型”(MoE)架构。这个架构在每次运算时,只需要激活一部分参数,从而降低运算量,而 Kimi 让激活率进一步减小。
目前为止,他们还没有激活参数的数量,发布报告只提到这样一段话:
“我们还扩展了专家混合模型 (MoE) 的稀疏性,当与 Stable LatentMoE 框架结合使用时,能够有效激活 896 位专家中的 16 位。结合改进的训练和数据处理方法,这些结构性变化使得整体扩展效率相比 Kimi K2 提升了约 2.5 倍,从而使模型能够更有效地将计算转化为智能。”
根据这段话,Kimi K3 有896位专家,相当于每位专家对应 3.13B 参数(2800/896),那么激活16位专家,就相当于激活 50B 参数。
这段话还说,k3 比 k2 的效率提升2.5倍。K2 共有 1T 参数,激活 32B,效率是 3.2%,除以2.5就是1.28%,相当于 2.8T 参数激活 36B。
不管 50B 还是 36B,都表明 Kimi K3 是一个相当稀疏的模型,激活参数的比例变得更小,所以公告才说“我们扩展了专家混合模型 (MoE) 的稀疏性”。
因此,K3 的实际运算量并不像表面看上去那么大。
四、
Kimi 还使用了其他降低运算量的方法,除了增加参数稀疏度以外。
K3 这一次的上下文窗口也变大了,从 256K 增加到 1M,这会增加显存占用。他们采用一种叫做 Kimi Delta Attention(KDA)的方法,随着新的上下文加入,会动态删除一部分过去的信息,从而减低显存占用。
另外,大家知道,模型分成好多层,如果每一层都进行运算,很耗费算力。他们使用 Attention Residuals(注意力残差)技术,动态选择跳过一些层,这样也就节省了算力。
我对这些技术的细节也不懂,没法谈得更深入。总之,通过种种方法,Kimi K3 极大地减少运算量,从而使得超大的参数规模不至于带来可怕的成本。
五、
即使如此,Kimi K3 的使用成本还是很贵。你应该有心理预期,这是一个费用较高的模型。
它在国内的 API 定价是百万 Token 输入输出价格为20元/100元,比上一个版本 K2.7 Code 的6.7元/27元翻了好几倍,比国内的其他模型贵出很多。我觉得,它应该是目前国内最贵的模型了。
它在海外的 API 定价是3美元/15美元,与 Anthropic 公司的 Claude Sonnet 系列模型处于同一价格水平,也是迄今为止在海外卖得最贵的中国模型。
由于定价较高,它的每次任务的成本不低。根据 Artificial Analysis 的报告,它的每次任务的成本是0.94美元,与 GPT 5.6 Sol(1.04 美元)相近,但还是比 Claude 模型便宜很多,约为 Claude Opus 4.8(1.80 美元)的一半,更不要谈 Claude Fable 5 了。
好消息是,每个任务的 Token 消耗量下降了,K3 比 K2.6 减少了21%的输出 Token,这样有助于节省费用。
六、
下面就是我对 Kimi K3 的测试。我参考一篇国外的评测报告[8],把同样的测试题让 Kimi K3 跑,直接跟现有的结果比较就行了。
我选择两个国外目前顶尖的旗舰模型 Claude Fable 5 和 GPT 5.6 Sol,作为 Kimi K3 的比较对象。
所有测试的结果都上网了,点击链接就能查看。
测试一:生成一个 DOOM 式的 3D 迷宫,有天花板、地板和砖墙,以第一人称视角,可以用 WASD 四个键上下左右移动。
[提示词] First-person raycaster you walk with WASD, shaded walls with depth, floor and ceiling, collision.
Claude Fable 5[9]
GPT 5.6 Sol[10]
Kimi K3[11]
大家可以点进去比较一下,觉得哪个更好?
我认为,第一名是 GPT 5.6,跟原始游戏 DOOM 最接近,加入了枪和准星,右下角还有小地图。
Kimi K2 排名第二,迷宫感觉足,操作流畅。Fable 5 排名第三,非常普通,它的道路不知为何特别窄,前进的时候脸都要贴着砖头。
七、
测试二:生成一个三维魔方的游戏,可以用动画形式,一步步展示自动打乱和还原魔方的过程。
[提示词] Build a colorful, 3D-looking Rubik's Cube with Scramble and Solve buttons that visibly animate the rotations.
Claude Fable 5[12]
GPT 5.6 Sol[13]
Kimi K3[14]
这一轮,GPT 5.6 明显垫底,生成的魔方毫无质感。其他两个很难分出高下,魔方都非常逼真,动画流畅。
八、
测试三:生成一个可以运算的计算器。
[提示词] Digits, operators, clear, equals, correct operator precedence, real calculator look.
Claude Fable 5[15]
GPT 5.6 Sol[16]
Kimi K3[17]
这一轮,三个计算器都能正常工作,但是细节方面都有缺失。
GPT 5.6 各方面比较均衡,但是样式普通,Kimi K3 最漂亮,但是 C 键太长了,而且缺少退位键,可以并列第一。Fable 5 不知为何多出了一个空的键位,只能排在后面了。
九、
测试题:生成一幅 SVG 图片,内容是马骑着宇航员,在月球上奔跑。
[提示词] Draw a SVG (no raster, no libraries) of a scene: a horse riding piggyback on an astronaut walking on the moon.
Claude Fable 5[18]
GPT 5.6 Sol[19]
Kimi K3[20]
这一轮,Fable 5 明显是最好的,不仅画面准确和形象,还多出了旗帜和对话。
Kimi K3 排名第二,动物形象很逼真,我猜有人可能更喜欢这个实现。GPT 5.6 比其他两个差一点,马和宇航员的形象都挺奇怪的。
十、
通过以上四个测试,可以看到,Kimi K3 的表现,完全不比那些旗舰模型逊色,比起上一个版本进步显著。参数数量的增大,确实对模型效果有很大帮助。
你可能会说,这些题难度不高,不足以看出模型的能力。但是横向来看,Fable 5 也就那么回事,并没有明显高出其他人一大截。
考虑到 Kimi K3 的价格不到 Fable 5 的三分之一,有这样的表现,加上权重开源,可以自由部署,这会不会让 Anthropic 公司创始人达里奥·阿莫迪(Dario Amodei)晚上睡不着觉,希望如此吧。
Kimi K3 的 2.8T 参数,相信只是一个开端,拉开了中国开源模型走向大型化的序幕,未来以 T 为参数单位的模型必将层出不穷。只要算力跟上,国产开源模型赶上并超越国外旗舰模型是完全可能的。
(完)
References
[1] Kimi K3:https://www.kimi.com/blog/kimi-k3[2]第一名:https://arena.ai/leaderboard/code/webdev[3]第三:https://x.com/ArtificialAnlys/status/2077832874183860404[4]GDPval v2:https://artificialanalysis.ai/#gdpval[5]Writing Elo:https://x.com/Whats_AI/status/2077860441380798908[6]BridgeBench:https://x.com/bridgebench/status/2078109314074443846[7]Next.js:https://nextjs.org/evals[8]评测报告:https://www.tryai.dev/blog/gpt-5.6-build-off-12-models[9]Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/raycaster/claude-fable-5/attempt-1.html[10]GPT 5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/raycaster/gpt-5.6-sol/attempt-5.html[11]Kimi K3:https://ruanyf.github.io/ai-test-case/kimi-k3/case01/index.html[12]Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/grok-4.5-buildoff/rubiks-cube/claude-fable-5.html[13]GPT 5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/rubiks-cube/gpt-5.6-sol/attempt-5.html[14]Kimi K3:https://ruanyf.github.io/ai-test-case/kimi-k3/case02/index.html[15]Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/calculator/claude-fable-5/attempt-1.html[16]GPT 5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/calculator/gpt-5.6-sol/attempt-1.html[17]Kimi K3:https://ruanyf.github.io/ai-test-case/kimi-k3/case03/index.html[18]Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/svg/claude-fable-5.png[19]GPT 5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/svg/gpt-5.6-sol.png[20]Kimi K3: https://ruanyf.github.io/ai-test-case/kimi-k3/case04/horse-astronaut-moon.svg