阮一峰的网络日志

如何看待 GLM 5.2 的开源模型排名第一

一、引言

智谱本周发布了最新的旗舰模型 GLM 5.2[1],立刻引发了轰动。

当天正赶上 Fable 5 模型关闭,而智谱在同一天开源 GLM 5.2,很难让人不把这两件事联系起来。

而且,GLM 5.2 模型的能力定位非常高。官方的发布公告[2]直接说:

“在标准编码基准测试中,GLM-5.2 是最强的开源模型。”

根据智谱自己公布的基准测试成绩,GLM 5.2 的代码能力,在所有开源模型中排名第一;跟国外的旗舰模型比较,只略微落后于 Opus 4.8,强于 GPT 5.5 和 Gemini 3.1 pro。

Image

(图片说明:蓝色为 GLM 5.2。来源:官方发布公告)

应该怎么看待这个开源模型第一的排名?GLM 5.2 真的有这么强吗?

二、第三方机构的排名

说实话,我一开始没太关注这件事。

现在每个月都出现大量新模型,谁不在发布的时候,大力宣扬自己的能力?再说了,这些测试都是智谱自己测的,不能完全做数。

但是,我很快就看到,第三方机构也发布了排名。

(1)全球最权威的大模型榜单网站 arena.ai[3],在 WebDev(网络开发)榜单中,把 GLM 5.2 排在世界第二。

Image

它仅次于 Fable 5,高于 Opus 4.8 和 Opus 4.7。

(2)Design Arena[4] 更惊人,直接把 GLM 5.2 排到了世界第一。

Image

这个榜单比的是 AI 作品(网页、游戏、PPT 等)的美感,由用户投票决定。它的网站显示,在1771次评比中,GLM 5.2 有731次被评为第一。

(3)独立的大模型评测网站 Artificial analysis[5] 把 GLM 5.2 排在世界第四,开源模型第一。

Image

上面这三个榜单,都是海外知名的第三方评测,公认比较客观。它们对 GLM 5.2 评价这么高,让人不得不重视。

三、我的评测

我于是也对 GLM 5.2 进行了测试。

不过,我的测试题[6]大多是网页编程,对于这种顶级模型实在是大材小用。而且,GLM 5.2 这次的上下文窗口放大到100万 Token(后文详谈),我也没有能用满这么大窗口的题目。

所以,下面的测试只是简单比较它跟其他模型在日常编程的表现。我已经把生成结果放到网上,大家可以访问下面的链接,自己查看。

(1)网页 UI 重构[7]。

Image

GLM 5.2 的生成结果(上图),跟 GLM 5.1 几乎毫无差别,看上去都是四平八稳。

我正好看到国外网友用它跟其他模型做网页 UI 对比,我把结果放在下面。

Image

股票交易网站,左侧是 GLM 5.2,右侧是 GPT 5.4。

Image

电商网站,左侧是 GLM 5.2,右侧是 Grok 4.20。

Image

在线学习网站,左侧是 GLM 5.2,右侧是小米 MIMO V2.5 pro。

Image

读书网站,左侧是 GLM 5.2,右侧是 GPT 5.4。

GLM 5.2 的表现挺不错,基本上每个设计都能让人认可。尤其是那个学习网站[8],我很喜欢,可能因为不涉及到商务,就没套模版,反而更有灵气。

(2)网页 3D 动画测试《天体模拟器》[9]。

Image

总体上,这个页面相当好:控制面板清晰合理,分布在页面两侧,不像有的模型都做在一侧,导致出现垂直滚动条。

只是有些地方如果能做得更美观一点,就更好了,比如下面这个“添加天体”的面板。

Image

它的“天体运动”动画效果,属于所有模型里面最流畅的级别,不知大家能否看清。可惜的是,它没做动画放大的效果。

Image

(3)网页游戏测试《愤怒的小鸟》[10]。

Image

生成效果也属于所有模型中最好的那一类,游戏可玩,碰撞后积木会倒塌,并且小鸟落地后会在地面滚动。

(4)Node.js 脚本测试“词云生成工具[11]”。

生成的命令行工具接受一个文本文件作为参数,统计该文件的词汇出现频率,生成对应的“词云图”。

Image
Image

上图是第一张是 GLM 5.2 的生成结果,第二张是 Opus 4.6 的生成结果。我感觉前者的展示效果更好。

(5)SVG 图片生成测试《骑自行车的鹈鹕》[12]。

我的生成结果是下图。

Image

不知道为何,这个测试的发明人 Simon Willison 使用 GLM 5.2 得到的[13]是一个有动画效果的 SVG,我的提示词明明跟他一样啊……

Image

(6)总结

所有测试的结果,GLM 5.2 都属于“最好”或“比较好”的类别,没有一个测试失败。

我现在可以确认,它肯定是目前最强的开源模式之一。

四、GLM 5.2 的上下文窗口

从技术上来看,GLM 5.2 与上个版本 GLM 5.1 的参数量是一样的,都是7530亿个。两者的最大差别,就是上下文窗口变大了,从20万增加到了100万。

所以,它处理复杂项目和长程任务的能力,一定好于5.1,因为每轮对话可以附带更多的 Token。

但是,更大的上下文必然带来计算量激增和处理速度下降。发布报告披露,作为应对之策,GLM 5.2 在内部添加了索引(IndexShare)和键值对缓存(KVShare),通过扩大数据存储,尽可能减少计算量,提高速度。

另外,它内部还带有工作量控制,防止过度运算。只有当用户明确需要最大的工作量级别,才会分配额外的计算资源。

因此,相同 Token 的情况下,GLM 5.2 的运算速度肯定大大快于 5.1 版本。即使用满了100万 Token 的上下文窗口,GLM 5.2 的运算速度也不会过分缓慢。

五、使用注意点

虽然 GLM 5.2 确实比较强,但是有一些地方是大家必须知道的。

(1)它不是多模态模型,没有图像和视频理解能力。智谱有一个专门的视觉模型 GLM-5V-Turbo,但没有集成到 GLM 5.2。

(2)根据 Artificial Analysis 的报告[14],GLM 5.2 的 Token 输出量有所增加。

每个任务使用 43k 个输出 Token,其中 37k 个用于推理。这比 GLM-5.1 (26k) 有所增加,也高于同类开放权重模型 MiniMax-M3 (24k) 和 Kimi K2.6(35k)。

六、总结,以及马斯克的评论

GLM 5.2 的代码能力,无疑是目前开源模型中最强之一。

如果按照智谱自己的说法,它强于 Opus 4.7(发布日期2026年4月),略逊于 Opus 4.8(发布日期2026年5月)。按照字面理解,国产开源模型落后于美国旗舰模型,也就只有两三个月的差距。

就在我写这篇文章的时候,看到昨晚特斯拉创始人马斯克在社交平台回复网友问题:“你对中国达到 Fable 模型级别的预计时间表是什么?GLM-5.2 无疑缩短了差距。”他回答:“或许(2027年)一季度。”

Image

智谱创始人唐杰在下面回复说“用不了那么久”。

这就有意思了,2026年只剩下六个月,这难道说明,智谱下半年还有大招要放吗?

(完)

References

[1] GLM 5.2:https://docs.z.ai/guides/llm/glm-5.2
[2]发布公告:https://z.ai/blog/glm-5.2
[3]arena.ai:https://arena.ai/leaderboard/code/webdev
[4]Design Arena:https://www.designarena.ai/models/silo
[5]Artificial analysis:https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index
[6]测试题:https://github.com/ruanyf/ai-test-case
[7]网页 UI 重构:https://ruanyf.github.io/ai-test-case/glm-5.2/case01/index.html
[8]学习网站:https://www.designarena.ai/models/silo
[9]《天体模拟器》:https://ruanyf.github.io/ai-test-case/glm-5.2/case02/index.html
[10]《愤怒的小鸟》:https://ruanyf.github.io/ai-test-case/glm-5.2/case03/index.html
[11]词云生成工具:https://ruanyf.github.io/ai-test-case/glm-5.2/case07/index.js
[12]《骑自行车的鹈鹕》:https://ruanyf.github.io/ai-test-case/glm-5.2/case08/pelican-bicycle.svg
[13]得到的:https://simonwillison.net/2026/Jun/17/glm-52/
[14]Artificial Analysis 的报告: https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index