PostgreSQL码农集散地

Claude 和 GPT 轮流坐庄,但且用且珍惜吧

Image

模型确实变强了,但"强了多少"需要打问号

GPT-5.6 一口气端出三款模型:Sol(旗舰)、Terra(平衡)、Luna(轻量)。旗舰 Sol 在 Terminal-Bench 2.1 这个编程评测上拿到了 88.8%——比上一代 GPT-5.5 的 88.0% 高了不到 1 个百分点,但比 Claude Mythos 5 的 84.3% 高了 4.5 个点。如果 Sol Ultra 模式(调度多个子智能体协同处理)也计入,数字可以飙到 91.9%。

站在一个做过多年模型评测的人的角度,我会说:这个提升是真实的,但幅度被精心包装过。 Terminal-Bench 2.1 是 OpenAI 自己大力推广的评测集,不是中立的第三方评测。GPT-5.5 到 Sol 的 0.8 个点差距,放在正常的迭代周期里就是一次常规升级——但配上"超越 Mythos 5"的叙事,就变成了"最强模型"。

真正值得关注的不是这个数字本身,而是 150 万 token 的上下文窗口。GPT-5.5 是 105 万,增幅 43%。但上下文窗口的长度从来不是瓶颈,窗口尾部的内容质量才是。 如果你让模型读一本 150 万 token 的书,它能不能在第 149 万 token 的地方还记得第一章说了什么?这个问题,目前没有任何公开评测能回答。

定价才是真正的"核弹"

如果我是一个独立开发者或者小团队的技术负责人,我不会盯着 Terminal-Bench 的分数看——我会盯着定价表。

  • Terra:输入 15/百万 token。性能"可以与 GPT-5.5 竞争",价格直接砍半。
  • Luna:输入 6/百万 token。最便宜的选项。

这意味着原来用 GPT-5.5 觉得"贵但能用"的团队,现在可以用 Terra 做全量部署,成本直接减半。原来根本不敢碰 API 调用的个人开发者,现在 Luna 的价格低到可以当玩具玩。

但站在科技行业分析师的角度,这个定价策略有一个更深的信号:OpenAI 在复制 Anthropic 的打法。 Anthropic 靠 Sonnet(高性能平价)+ Opus(旗舰)的两 tier 体系抢走了大量开发者心智。OpenAI 现在用 Sol/Terra/Luna 的三 tier 体系正面回应——而且 Terra 直接定价在 Anthropic 快速模式的价格区间(Claude Opus 4.8 快速模式仅为 GPT-5.5 的 1/3)。

这是一场价格战的开始,不是结束。

发布方式本身比模型更重要

现在把镜头拉远。如果你关注的不只是模型参数,而是 AI 行业的治理走向,GPT-5.6 的发布方式比模型本身更值得记住。

OpenAI 在官方博客中明确写道:在发布前已向美国政府展示 GPT-5.6 的能力与发布计划。根据美国政府要求,模型以"有限预览"形式上线,仅向约 20 家经过政府批准的合作伙伴开放,且这些合作伙伴的信息已与政府共享。个人用户——目前——没有申请通道。

OpenAI 同时表态:不认为政府参与模型访问流程应当成为长期默认机制。

这两句话放在一起,本身就是一份矛盾的声明。OpenAI 在说:"我们希望模型尽可能广泛地开放,但现实是,我们需要和政府合作才能做到这一点。"

站在 AI 安全研究者的角度,这种矛盾的信号很危险。当模型能力的发布需要政府审批时,"谁能用最强模型"就从一个技术问题变成了一个政治问题。 中国开发者用不了、欧盟监管框架不明、美国公司需要政府背书——全球 AI 市场正在被切割成不同的"访问圈层"。

Anthropic 两个月前的 Fable 5 事件已经在预演这个剧本:美国政府要求限制外国公民使用 Fable 5,Anthropic 被迫停用该模型。现在 OpenAI 主动接受了这个框架,只是把它包装成了"短期步骤"。

对投资者来说,价值在转移

作为一只 AI 基金的基金经理,我看到的最重要信号不是 Sol 有多强,而是 价值正在从模型层流向应用层。

当最强的模型开始变成最便宜的模型之一时,模型层的护城河在快速窄化。OpenAI、Anthropic、Google 三强的能力差距已经缩小到"够用就好"的区间——对绝大多数应用场景来说,用 Terra 还是用 Claude Sonnet,差异远小于你在应用层做多少优化。

真正值得下注的方向是:谁能在 Terra 这个价格点上构建出最好的产品体验。 过去两年 AI 投资的核心逻辑是"赌模型赢家",但这个逻辑正在快速失效。未来两三年,AI 应用层的并购和 IPO 活动会明显加速——因为 VC 意识到,模型层的回报在递减,而应用层的 PMF(产品市场契合度)才刚刚开始被验证。

另一个值得关注的信号是 Cerebras 合作。7 月份,GPT-5.6 Sol 将登陆 Cerebras 芯片,速度最高可达每秒 750 个 token。这不是一个小补丁——如果兑现,它会解锁大量对延迟极度敏感的实时 Agent 应用场景。750 tokens/秒意味着一个复杂的多步骤任务可以在秒级完成,而不是分钟级。

三句话总结这次更新

第一:模型确实变强了,但"最强"的叙事包装比实际增量更显眼。等第三方独立评测出来之前,对 benchmark 数字保持一份怀疑。

第二:Terra 降价一半是这次更新对行业影响最大的动作。它标志着 AI 模型从"能力竞赛"正式进入"成本竞赛"。

第三:有限预览 + 政府审批是 GPT-5.6 最容易被忽略、但长期影响最大的信号。AI 的"开放时代"可能正在画上句号,"审批时代"正在开启。