alitrack

GLM-5.2:753B 开源旗舰出世,编码超 GPT-5.5,价格仅 1/6

6 月 13 日发布,MIT 协议,1M 上下文,港股当日暴涨 34%。恰逢 Fable 5 因出口管制下架——时机不是巧合。

● ● ●

一、为什么这篇值得看

如果你只关心一件事:现在有没有一个开源模型,编码能力逼近闭源顶配、上下文够塞下一个完整项目、MIT 协议不限地域、价格还便宜一个数量级?

GLM-5.2 是目前离这个答案最近的模型。

6 月 13 日傍晚 5:21,智谱 AI 向 GLM Coding Plan 全量用户开放了 GLM-5.2。六天后,下周,MIT 权重和 API 将同步上线。今天港股已经先涨了 34%。

这不是一次常规的模型迭代。


● ● ●

二、先看硬指标

核心规格跃升

维度GLM-5.1(前代)GLM-5.2(旗舰)
上下文200K**1M**
最大输出~26K tokens**128K tokens**
思考强度单档**High / Max 双档**
架构744B MoE - 40B 激活**同架构 + IndexShare 优化**
1M 下每 token FLOPs基准**降低 2.9 倍**
开源协议MITMIT

注意这组数字的内在逻辑:

1M 上下文 不是炫技。一个 400 文件的 Next.js 项目大约 200K~400K tokens,一个完整 monorepo 带测试和配置大约 500K~900K。GLM-5.1 的 200K 只能装四分之一。5.2 的 1M 意味着你可以把整个中型代码库一次性丢进上下文,不再需要 chunking 和状态拼接。

128K 输出 同样不是数字游戏。以前 26K 的输出上限,一个完整的跨文件重构得拆成多轮对话。现在一轮写完。

IndexShare(智谱这次的核心架构创新)在每四个稀疏注意力层之间复用同一个索引器。效果:1M 上下文下的计算量降低到原来的 1/3 不到。这不是软优化,是硬工程。


● ● ●

三、Benchmark:有数据说数据

智谱这次做了个有趣的决定:发布时不公布任何 benchmark 数据。 先让开发者实测,再让社区出数据。等下周权重到手,SWE-bench Verified、LiveCodeBench 的数字自然会出来——而且比官方更有公信力。

不过随着社区陆续补上,我们已经有了一组很有说服力的数字:

GLM-5.2 Benchmark 官方图

GLM-5.2 Benchmark 官方图

关键基准

测试GLM-5.2对比模型
**SWE-bench Pro**(软件工程)**62.1**GPT-5.5: 58.6
**Terminal-Bench 2.1**(终端任务)**81.0**Claude Opus 4.8: 85.0
**FrontierSWE**(长程任务)**74.4%**Opus 4.8: 75.1%, GPT-5.5: 72.6%
**AIME 2026**(数学竞赛)**99.2**排名 **#1/15**
**IMO-AnswerBench**(奥赛)**91.0**排名 **#1/20**
**HLE w/ Tools**(人类最后考试)**54.7**排名 **#8/159**
**Design Arena ELO****1360**第一,超 Claude Fable 5
**MCP-Atlas**(工具使用)**77.0**GPT-5.5: 75.3
**BenchLM 综合得分****94/100**临时榜 #3/124,验证榜 #9/33

几个值得注意的点:

  • SWE-bench Pro 62.1 超过 GPT-5.5(58.6),逼近闭源顶配
  • Terminal-Bench 2.1 81.0,Cline IDE 评价:"首个在 Terminal-Bench 突破 80% 的开源权重模型"
  • AIME 2026 99.2,排名第一——数学推理已经到了最强梯队
  • 综合 BenchLM 临时榜排 #3/124,所有模型排第三

与前代对比

测试GLM-5.1GLM-5.2提升
SWE-bench Pro58.4**62.1**+3.7
Terminal-Bench 2.163.5**81.0****+17.5**
AIME 202695.3**99.2**+3.9

Terminal-Bench 的提升幅度(17.5 分)说明 5.2 在真实终端操作能力上做了质的优化,不是挤牙膏式升级。


● ● ●

四、架构深挖:IndexShare 到底做了什么?

GLM-5.2 继承了 GLM-5 的技术路线:

  • MoE 架构:78 层 Transformer,前 3 层稠密,后续 75 层用混合专家。256 个专家,每个 token 激活其中 8 个。总参数量 753B(HuggingFace safetensors 元数据),激活参数约 40B。
  • DSA(DeepSeek Sparse Attention):集成了 DeepSeek 的稀疏注意力机制,降低长上下文部署成本。
  • SLIME 异步 RL 框架:智谱自研的强化学习基础设施,用于后训练,支持细粒度迭代。

IndexShare:降低 2.9 倍计算量

IndexShare 的核心思路:在稀疏注意力中,每四层之间共享同一个索引器(indexer),而不是每层都独立计算。

效果:1M 上下文下,每 token 的 FLOPs 降低 2.9 倍。同时 MTP(Multi-Token Prediction)推测解码的接受长度提升最多 20%。

论文在这里:arxiv.org/abs/2603.12201(2026 年 3 月)。

训练在华为昇腾芯片 + MindSpore 框架上完成,Day 0 适配国产算力平台。严格意义上的全栈自主可控。


● ● ●

五、价格:这可能是最炸裂的部分

API 定价(美元 / 1M tokens)

输入输出合计
**GLM-5.2****$1.40****$4.40****$5.80**
GPT-5.5$5.00$30.00**$35.00**
Claude Opus 4.8~$15~$75~$90

GLM-5.2 的综合 API 价格是 GPT-5.5 的 1/6。

如果这还不够直接——国内 360 智脑平台报价:输入 ¥6 / 1M tokens,输出 ¥24 / 1M tokens。

套餐定价

智谱还推出了 GLM Coding Plan 按次计费方案:

套餐月费(年付)每周次数适合
Lite~$12.60~400个人探索
Pro~$50.40~2,000全职开发
Max~$112.00~8,000重 Agent 工作流
Team定制定制团队

注意:按次计费下,一个多步骤 agent 任务的每次 tool call 都算一次调用。Lite 的 400 次/周在重 Agent 场景下可能不够,Pro 或 Max 更实际。

自部署

权重 MIT 协议,约 1.5TB BF16,FP8 版本同步发布。支持 SGLang、vLLM、Transformers、KTransformers。对于有 GPU 集群的团队,自部署后成本只有电费。


● ● ●

六、开源生态:MIT 的含金量

GLM-5.2 用的是 MIT License——最宽松的开源协议。

对比同类:

  • Kimi K2.7-Code:修改版 MIT,禁止训练竞争模型
  • GLM-5.2:MIT,无任何限制——可商用、可修改、可微调、可再分发

对于有合规要求的企业客户,MIT + 无地域限制意味着可以部署在任何区域、任何设备上,不受出口管制影响。

生态集成(发布当天全部可用)

工具支持状态
Claude Code`glm-5.2[1m]` 模型 ID 接入,1M 上下文
Cline当日确认 Terminal-Bench 81.0
OpenClaw / OpenCode / Roo CodeOpenAI 兼容端点接入
Kilo CodeDay 1 集成确认

● ● ●

七、更大的叙事:时机与地缘政治

GLM-5.2 的发布踩在了一个极其戏剧化的时间节点。

就在前一天,美国特朗普政府以国家安全为由,要求 Anthropic 下架 Claude Fable 5 和 Mythos 5,并禁止特定国家/地域的用户使用。这不是传闻——是白宫行政令。

智谱在知乎官宣文章中的原话:

"在一些前沿模型突然变得不可用的时刻,我们选择相信另一条路:前沿智能不应只属于少数人,也不应被少数规则随时收回。"

这段话的潜台词很清楚:如果你所在的地区、你的企业合规要求、你的供应链安全需要你避开美国模型的出口管制,GLM-5.2 是一个现成的替代选项。

而且这是开源模型——你可以自己部署,自己控制数据流向,没有 API 调用被记录的风险。


● ● ●

八、限制与实话

GLM-5.2 不是万能的。以下是在使用前需要知道的:

1. 纯文本模型

不支持多模态。没有图像输入、没有视频理解。如果你需要多模态能力,还需要搭配其他模型。

2. 部署门槛高

约 1.5TB BF16 权重,推理需要多 GPU 集群。FP8 版本可以降低存储需求,但硬件门槛仍然不低。

3. 1M 上下文 ≠ 1M 上下文利用率

上下文长度和有效注意力是两回事。多个前沿模型都证明过:超过 128K 后检索质量会显著下降。GLM-5.2 的 1M 是否真的在所有位置都保持了推理质量?目前没有第三方"大海捞针"测试数据。这是本文最大的知识空白。

4. 知识截止时间未公布

估计为 2025 年 11 月,但官方未确认。不适合需要最新知识的场景。

5. 推理速度

360 智脑平台数据显示:首字符延迟约 9.41s,吞吐量约 2-5 tokens/s。不是最快的,但 753B 参数这个规模上表现合理。


● ● ●

九、什么时候用?

现在就用:如果你的瓶颈是上下文窗口——代码库超过 200K tokens,你正在手动管理上下文分段。1M 的 5 倍提升是真实的流程改善,不需要等 benchmark 验证。

等数据再用:如果你的采购流程需要发表的 benchmark 数据。下周权重到手后社区会出 SWE-bench Verified 和 LiveCodeBench 数字。

不要只用:高风险场景建议 GLM-5.2 + 另一个已验证模型双模型架构——GLM-5.2 处理大上下文检索和长程生成,已验证的模型做代码审核和逻辑校验。


● ● ●

十、一句话

在开源模型能力上,GLM-5.2 第一次让"编码能力接近闭源顶配"不再是修辞,而是有多个 benchmark 数字支撑的事实陈述。

MIT 协议 + 1M 上下文 + 1/6 的价格 = 2026 年最值得关注的模型发布之一。


数据来源:Z.ai GitHub 官方 README、BenchLM.ai 排行榜、DataLearnerAI 模型卡、VentureBeat、ECIKS、Cline IDE(X 平台)。本文 GLM-5.2 发布时官方未公布 benchmark,文中数据来自社区和第三方陆续补全的结果。