GLM-5.2:753B 开源旗舰出世,编码超 GPT-5.5,价格仅 1/6
6 月 13 日发布,MIT 协议,1M 上下文,港股当日暴涨 34%。恰逢 Fable 5 因出口管制下架——时机不是巧合。
● ● ●
一、为什么这篇值得看
如果你只关心一件事:现在有没有一个开源模型,编码能力逼近闭源顶配、上下文够塞下一个完整项目、MIT 协议不限地域、价格还便宜一个数量级?
GLM-5.2 是目前离这个答案最近的模型。
6 月 13 日傍晚 5:21,智谱 AI 向 GLM Coding Plan 全量用户开放了 GLM-5.2。六天后,下周,MIT 权重和 API 将同步上线。今天港股已经先涨了 34%。
这不是一次常规的模型迭代。
● ● ●
二、先看硬指标
核心规格跃升
| 维度 | GLM-5.1(前代) | GLM-5.2(旗舰) |
|---|---|---|
| 上下文 | 200K | **1M** |
| 最大输出 | ~26K tokens | **128K tokens** |
| 思考强度 | 单档 | **High / Max 双档** |
| 架构 | 744B MoE - 40B 激活 | **同架构 + IndexShare 优化** |
| 1M 下每 token FLOPs | 基准 | **降低 2.9 倍** |
| 开源协议 | MIT | MIT |
注意这组数字的内在逻辑:
1M 上下文 不是炫技。一个 400 文件的 Next.js 项目大约 200K~400K tokens,一个完整 monorepo 带测试和配置大约 500K~900K。GLM-5.1 的 200K 只能装四分之一。5.2 的 1M 意味着你可以把整个中型代码库一次性丢进上下文,不再需要 chunking 和状态拼接。
128K 输出 同样不是数字游戏。以前 26K 的输出上限,一个完整的跨文件重构得拆成多轮对话。现在一轮写完。
IndexShare(智谱这次的核心架构创新)在每四个稀疏注意力层之间复用同一个索引器。效果:1M 上下文下的计算量降低到原来的 1/3 不到。这不是软优化,是硬工程。
● ● ●
三、Benchmark:有数据说数据
智谱这次做了个有趣的决定:发布时不公布任何 benchmark 数据。 先让开发者实测,再让社区出数据。等下周权重到手,SWE-bench Verified、LiveCodeBench 的数字自然会出来——而且比官方更有公信力。
不过随着社区陆续补上,我们已经有了一组很有说服力的数字:
GLM-5.2 Benchmark 官方图
关键基准
| 测试 | GLM-5.2 | 对比模型 |
|---|---|---|
| **SWE-bench Pro**(软件工程) | **62.1** | GPT-5.5: 58.6 |
| **Terminal-Bench 2.1**(终端任务) | **81.0** | Claude Opus 4.8: 85.0 |
| **FrontierSWE**(长程任务) | **74.4%** | Opus 4.8: 75.1%, GPT-5.5: 72.6% |
| **AIME 2026**(数学竞赛) | **99.2** | 排名 **#1/15** |
| **IMO-AnswerBench**(奥赛) | **91.0** | 排名 **#1/20** |
| **HLE w/ Tools**(人类最后考试) | **54.7** | 排名 **#8/159** |
| **Design Arena ELO** | **1360** | 第一,超 Claude Fable 5 |
| **MCP-Atlas**(工具使用) | **77.0** | GPT-5.5: 75.3 |
| **BenchLM 综合得分** | **94/100** | 临时榜 #3/124,验证榜 #9/33 |
几个值得注意的点:
- SWE-bench Pro 62.1 超过 GPT-5.5(58.6),逼近闭源顶配
- Terminal-Bench 2.1 81.0,Cline IDE 评价:"首个在 Terminal-Bench 突破 80% 的开源权重模型"
- AIME 2026 99.2,排名第一——数学推理已经到了最强梯队
- 综合 BenchLM 临时榜排 #3/124,所有模型排第三
与前代对比
| 测试 | GLM-5.1 | GLM-5.2 | 提升 |
|---|---|---|---|
| SWE-bench Pro | 58.4 | **62.1** | +3.7 |
| Terminal-Bench 2.1 | 63.5 | **81.0** | **+17.5** |
| AIME 2026 | 95.3 | **99.2** | +3.9 |
Terminal-Bench 的提升幅度(17.5 分)说明 5.2 在真实终端操作能力上做了质的优化,不是挤牙膏式升级。
● ● ●
四、架构深挖:IndexShare 到底做了什么?
GLM-5.2 继承了 GLM-5 的技术路线:
- MoE 架构:78 层 Transformer,前 3 层稠密,后续 75 层用混合专家。256 个专家,每个 token 激活其中 8 个。总参数量 753B(HuggingFace safetensors 元数据),激活参数约 40B。
- DSA(DeepSeek Sparse Attention):集成了 DeepSeek 的稀疏注意力机制,降低长上下文部署成本。
- SLIME 异步 RL 框架:智谱自研的强化学习基础设施,用于后训练,支持细粒度迭代。
IndexShare:降低 2.9 倍计算量
IndexShare 的核心思路:在稀疏注意力中,每四层之间共享同一个索引器(indexer),而不是每层都独立计算。
效果:1M 上下文下,每 token 的 FLOPs 降低 2.9 倍。同时 MTP(Multi-Token Prediction)推测解码的接受长度提升最多 20%。
论文在这里:arxiv.org/abs/2603.12201(2026 年 3 月)。
训练在华为昇腾芯片 + MindSpore 框架上完成,Day 0 适配国产算力平台。严格意义上的全栈自主可控。
● ● ●
五、价格:这可能是最炸裂的部分
API 定价(美元 / 1M tokens)
| 输入 | 输出 | 合计 | |
|---|---|---|---|
| **GLM-5.2** | **$1.40** | **$4.40** | **$5.80** |
| GPT-5.5 | $5.00 | $30.00 | **$35.00** |
| Claude Opus 4.8 | ~$15 | ~$75 | ~$90 |
GLM-5.2 的综合 API 价格是 GPT-5.5 的 1/6。
如果这还不够直接——国内 360 智脑平台报价:输入 ¥6 / 1M tokens,输出 ¥24 / 1M tokens。
套餐定价
智谱还推出了 GLM Coding Plan 按次计费方案:
| 套餐 | 月费(年付) | 每周次数 | 适合 |
|---|---|---|---|
| Lite | ~$12.60 | ~400 | 个人探索 |
| Pro | ~$50.40 | ~2,000 | 全职开发 |
| Max | ~$112.00 | ~8,000 | 重 Agent 工作流 |
| Team | 定制 | 定制 | 团队 |
注意:按次计费下,一个多步骤 agent 任务的每次 tool call 都算一次调用。Lite 的 400 次/周在重 Agent 场景下可能不够,Pro 或 Max 更实际。
自部署
权重 MIT 协议,约 1.5TB BF16,FP8 版本同步发布。支持 SGLang、vLLM、Transformers、KTransformers。对于有 GPU 集群的团队,自部署后成本只有电费。
● ● ●
六、开源生态:MIT 的含金量
GLM-5.2 用的是 MIT License——最宽松的开源协议。
对比同类:
- Kimi K2.7-Code:修改版 MIT,禁止训练竞争模型
- GLM-5.2:MIT,无任何限制——可商用、可修改、可微调、可再分发
对于有合规要求的企业客户,MIT + 无地域限制意味着可以部署在任何区域、任何设备上,不受出口管制影响。
生态集成(发布当天全部可用)
| 工具 | 支持状态 |
|---|---|
| Claude Code | `glm-5.2[1m]` 模型 ID 接入,1M 上下文 |
| Cline | 当日确认 Terminal-Bench 81.0 |
| OpenClaw / OpenCode / Roo Code | OpenAI 兼容端点接入 |
| Kilo Code | Day 1 集成确认 |
● ● ●
七、更大的叙事:时机与地缘政治
GLM-5.2 的发布踩在了一个极其戏剧化的时间节点。
就在前一天,美国特朗普政府以国家安全为由,要求 Anthropic 下架 Claude Fable 5 和 Mythos 5,并禁止特定国家/地域的用户使用。这不是传闻——是白宫行政令。
智谱在知乎官宣文章中的原话:
"在一些前沿模型突然变得不可用的时刻,我们选择相信另一条路:前沿智能不应只属于少数人,也不应被少数规则随时收回。"
这段话的潜台词很清楚:如果你所在的地区、你的企业合规要求、你的供应链安全需要你避开美国模型的出口管制,GLM-5.2 是一个现成的替代选项。
而且这是开源模型——你可以自己部署,自己控制数据流向,没有 API 调用被记录的风险。
● ● ●
八、限制与实话
GLM-5.2 不是万能的。以下是在使用前需要知道的:
1. 纯文本模型
不支持多模态。没有图像输入、没有视频理解。如果你需要多模态能力,还需要搭配其他模型。
2. 部署门槛高
约 1.5TB BF16 权重,推理需要多 GPU 集群。FP8 版本可以降低存储需求,但硬件门槛仍然不低。
3. 1M 上下文 ≠ 1M 上下文利用率
上下文长度和有效注意力是两回事。多个前沿模型都证明过:超过 128K 后检索质量会显著下降。GLM-5.2 的 1M 是否真的在所有位置都保持了推理质量?目前没有第三方"大海捞针"测试数据。这是本文最大的知识空白。
4. 知识截止时间未公布
估计为 2025 年 11 月,但官方未确认。不适合需要最新知识的场景。
5. 推理速度
360 智脑平台数据显示:首字符延迟约 9.41s,吞吐量约 2-5 tokens/s。不是最快的,但 753B 参数这个规模上表现合理。
● ● ●
九、什么时候用?
现在就用:如果你的瓶颈是上下文窗口——代码库超过 200K tokens,你正在手动管理上下文分段。1M 的 5 倍提升是真实的流程改善,不需要等 benchmark 验证。
等数据再用:如果你的采购流程需要发表的 benchmark 数据。下周权重到手后社区会出 SWE-bench Verified 和 LiveCodeBench 数字。
不要只用:高风险场景建议 GLM-5.2 + 另一个已验证模型双模型架构——GLM-5.2 处理大上下文检索和长程生成,已验证的模型做代码审核和逻辑校验。
● ● ●
十、一句话
在开源模型能力上,GLM-5.2 第一次让"编码能力接近闭源顶配"不再是修辞,而是有多个 benchmark 数字支撑的事实陈述。
MIT 协议 + 1M 上下文 + 1/6 的价格 = 2026 年最值得关注的模型发布之一。
数据来源:Z.ai GitHub 官方 README、BenchLM.ai 排行榜、DataLearnerAI 模型卡、VentureBeat、ECIKS、Cline IDE(X 平台)。本文 GLM-5.2 发布时官方未公布 benchmark,文中数据来自社区和第三方陆续补全的结果。