数据STUDIO

GPT-5.6 正式上线,Codex 和 ChatGPT 合并,顶级 Agent 能力开始按任务定价

Image

OpenAI 在周四正式推出了 GPT-5.6 系列,同时把 Codex 整合进了 ChatGPT 桌面应用,并发布了一个新的智能体工具 ChatGPT Work。三件事同一天发生,很容易让人觉得"OpenAI 又发了个新模型"。但如果只盯着跑分看,会漏掉这次发布真正改变的东西。

Image

GPT-5.6 的新模型确实能打——Sol 在 Agents' Last Exam、Coding Agent Index 和 Terminal-Bench 2.1 上都进入了和 Claude Fable 5 同一梯队的能力区间。

Image

但更值得关注的结构变化是另一件事:OpenAI 把顶级 Agent 能力拆成了可按任务购买的不同价格档位。 Sol、Terra、Luna 三档模型加上 medium / high / max / ultra 多级推理深度,同一个模型体系下出现了多个独立的价格-能力组合。再加上显式缓存断点和多 Agent 并行,单次任务的总成本不再由模型名称决定,而是由你选择的档位组合决定。

01Sol 很强,但不是全场景替代

先看硬数据。GPT-5.6 系列分三个能力层级:旗舰 Sol、均衡 Terra 和轻量 Luna。API 标价分别为每百万 token 5 / 2.5 / 1 美元(输入)和 30 / 15 / 6 美元(输出)——Sol 的标价约为 Fable 5 的一半,Terra 和 Luna 更低。

Image

在各家评测上,启用最高推理强度的 Sol 在覆盖 55 个领域的 Agents' Last Exam 上取得 53.6%。

Image

在 Coding Agent Index v1.1 上取得 80 分。

Image

在 Terminal-Bench 2.1 的 Ultra 模式下达到 91.9%——这三个数字分别是各自评测的当前最高或并列最高分,且均以低于 Fable 5 的 API 标价实现。

Image

但 SWE-Bench Pro 上的数字是 64.6%,而 Fable 5 是 80%。二者差距显著。

一个模型的单项评测落后,通常只能说明"它在这个特定评测定义和任务集合下不够好"。不能自动证明这是多 Agent 并行的固有缺陷,也不能反推出它在所有仓库级任务上都不行。但把领先和落后的评测放在一起看,一个模式开始显现:GPT-5.6 在任务路径明确、步骤可拆分的场景(命令行操作、终端测试、浏览器自动化)表现突出,在开放式的仓库级代码修改上出现缺口。Fable 5 的领先侧则正好相反——SWE-Bench Pro 80 分是一骑绝尘,但 Terminal-Bench 2.1 上反而被 Sol 甩开了近 9 个百分点。

OpenAI 官方对 SWE-Bench Pro 的结果提出了异议,声称约 30% 的评测实例存在结构性缺陷。这目前是厂商自述,没有独立裁决,不能当定论——但它确实提醒了一件事:任何单个 Benchmark 都不该被当作模型的"真实编码能力"全貌。

如果只看一条评测,你会得出"Sol 秒杀 Fable 5"或"Fable 5 吊打 Sol"两种完全相反的结论。把多条评测并排看,结论变成:Sol 已进入 Fable 5 的能力区间,但优势侧不同——选模型不再是选"谁更强",而是选"谁在你的任务类型上更稳"。

02三档模型 × 推理强度:一个选择框架

GPT-5.6 真正的结构变化不在性能排行榜上,而在价格表上。Sol / Terra / Luna 三个档位不是"好 / 中 / 差"的质量分层,是同一代模型体系下按能力密度定价的长期档位。每档之上再叠加 medium / high / max / ultra 等推理深度,形成了两轴独立的组合矩阵。

这不是 OpenAI 第一次做模型分层。但结合这次同步推出的显式缓存断点机制(最短保留 30 分钟,读取享 90% 折扣),和多 Agent 并行(默认 4 个,最高 16 个),整件事的实质是:OpenAI 把"用多少智能花多少钱"从一个模糊的套餐概念变成了可逐任务计算的算术。

基于公开价格和评测数据,一个初步的选择框架是这样的——但请注意,以下未经本地验证,是依据公开材料形成的初始建议:

任务类型
建议选择
理由
摘要、改写、轻量检索
Luna
速度和成本优先,任务本身不需要深度推理
多文件分析、常规办公材料、一般编码
Terra
能力与成本平衡,是大部分日常任务的默认起点
复杂研究、长链推理、重要代码修改
Sol high / max
降低返工风险,推理质量对这类任务有杠杆效应
大型仓库架构重构
Sol 与 Fable 5 应先做小样本对比
公开评测存在明显分化,唯一可靠的选择方法是自己用实际任务测一次
极高价值、天然可并行的任务
Sol Ultra
仅当并行收益 > 推理成本溢价时值得开

这个框架的核心不是"推荐哪个模型",而是把"值不值得换"从一个整体判断拆成了按任务类型的逐项判断。 你不必在"全部切到 GPT-5.6"和"继续用 Claude"之间二选一——你可以让不同类型的任务走不同的选择。

这比单纯的跑分排行榜有用,因为它回答的不是"谁考了最高分",而是"我的实际任务该花多少钱买多少智能"。

有一个公式可以帮助判断:任务总拥有成本 = (Token 成本 + 等待时间成本 + 返工成本) / (完成质量 × 成功率)。 Luna 的 Token 单价只有 Sol 的五分之一,但如果在一个需要跨多文件追踪依赖的任务上,它的上下文检索退化到 41.3%(MRCR 8-needle 评测数据),返工成本可能轻易吃掉 Token 省下来的部分。反过来,Sol 在 Terminal-Bench 上稳定跑完复杂命令行任务的能力,对关键基础设施变更的价值远超过它多花的 Token 成本。

03Codex 进 ChatGPT:Agent 从开发工具走向通用入口

模型之外,这次发布的产品动作同样值得关注。Codex 已进入 ChatGPT 桌面应用的统一入口——用户在同一个应用内可以在 Chat(对话)、Work(自主任务执行)和 Codex(专业开发)三种模式间切换。OpenAI 同时保留了 Codex 的独立产品名称、更新日志和专业功能(内联 diff、PR 审查、多仓库支持)。

ChatGPT 桌面应用菜单,已选择“工作”,下面还有 Codex、定时任务和站点。

这不是"Codex 被消灭了"。更准确的描述是:OpenAI 正在把 Agent 工作流从"开发者专属工具"扩展为 ChatGPT 的全员入口,同时保留 Codex 作为专业开发界面的能力品牌。

这个动作的商业逻辑很清楚。ChatGPT 有超过 10 亿周活用户,但其中绝大部分从未用过 Codex——不是因为不需要 Agent 类工具,是因为"Codex = 写代码工具"的心智模型把他们挡在了门外。把 Agent 执行能力放进 ChatGPT 的主界面,用一个叫 Work 的模式来承载,解决的就是这个心智门槛。

Image

ChatGPT Work 新增了几个关键能力:长任务追踪与审批、基于插件的自动调度、以及 Sites 一键部署。你可以让它监控 Slack 频道的客户反馈,每周自动更新会议议程;或者检测到新邮件反馈时自动更新演示文稿。这些功能在 Codex 的底层 Agent 引擎上都能实现,但 ChatGPT Work 的界面语言和交互模式面向的是非开发者。

Image

OpenAI 内部几乎 100% 的团队(包括财务和销售团队)现在都使用 ChatGPT Work 和 Codex 来加快工作速度、承担复杂任务,并花更多时间与客户互动。

这个策略的本质是:同一个 Agent 引擎,按用户角色提供不同的入口和交互层。 开发者继续在 Codex 里用终端和 diff,非开发者在 Work 里用文档、表格和定时任务。底层是一套东西,但心智模型不再绑定在"写代码"上。

ChatGPT 插件目录,显示已连接的工具,包括 Google Drive、Outlook Email、Gmail、Teams、Slack、SharePoint、Salesforce 和 Adobe Acrobat。

这比任何单次 Benchmark 排名都更值得长期关注。因为如果这个策略成功,Agent 工具的用户基数将从数百万开发者扩展到数亿知识工作者——那时候讨论"哪个模型在 SWE-Bench 上多几分"的语境,会和今天完全不同。

04写在最后

几件事目前还不能下结论,仍需观察。

SWE-Bench Pro 的争议——OpenAI 声称约 30% 实例有缺陷——需要独立第三方裁决。在裁决之前,SWE-Bench Pro 上的差距既不能忽视,也不该被当作 GPT-5.6 的定性标签。

安全策略与自主执行之间的张力也值得注意。OpenAI 的安全报告将 GPT-5.6 的安全体系描述为其"最强",并披露了更严格的行为监控和欺骗检测。但这些措施的"用户侧影响"——比如正常请求被拦截的概率——目前没有独立的量化数据。更强的自主性是否会被更保守的安全策略部分抵消,还要等更多实际使用数据出来才能判断。

最后,Anthropic 在 GPT-5.6 发布前夕重置了 Claude 订阅配额并延长了 Fable 5 的访问期限。竞争很激烈,受益的是用户。

Image
Image

一句话总结:GPT-5.6 的意义不是把能力榜重新排了一次,而是把顶级 Agent 能力拆成了可按任务购买的不同价格档位。在多数场景下,它让高性能 Agent 更便宜了。但便宜还不等于总成本更低——在高价值仓库级任务上,这一点尤其需要用自己的实际任务来验证。

Image

参考材料

  • OpenAI GPT-5.6 官方发布页 — openai.com/index/gpt-5-6
  • ChatGPT Work 官方发布页 — openai.com/index/chatgpt-for-your-most-ambitious-work
  • OpenAI 部署安全报告 — deploymentsafety.openai.com/gpt-5-6
  • Codex Changelog — help.openai.com/en/articles/11428266-codex-changelog
  • Artificial Analysis 基准测试 — artificialanalysis.ai

Image