GPT-5.5反击:OpenAI押注Agent
GPT-5.5在Terminal-Bench 2.0上拿下82.7%的准确率,比Claude Opus 4.7高出13个百分点。这不是跑分竞赛的又一个小数点之争——当OpenAI的旗舰模型开始自主规划任务、跨工具调用浏览器和本地软件、甚至协助发现拉姆齐数新证明时,大模型的战场已经从"谁更聪明"切换到了"谁能替你干活"。
01 八天后的反击
4月16日,Anthropic发布Claude Opus 4.7,在企业编码和智能体市场一路高歌。市场数据显示,Anthropic已占据企业编码市场54%的份额,OpenAI仅有21%;企业级Agent市场,Anthropic 40%,OpenAI 27%;2026年3月新采购AI服务的企业中,65%选择了Anthropic,OpenAI只有32%。
八天后,OpenAI的回应来了。GPT-5.5内部代号"Spud",4月23日上线ChatGPT和Codex平台,4月24日正式发布。时间节点选在Anthropic深陷"降智"争议之际,竞争意图不言自明。
OpenAI首席营收官Denise Dresser甚至公开批评Anthropic的"财务水分和运营不稳定性"。大模型之战,已经从技术博弈升级为商业攻防。
02 不是一个"小版本"
GPT-5.5的核心跃升在三个维度:
原生Agent能力。GPT-5.5不是在聊天界面上"增加工具按钮",而是从底层架构为自主任务执行设计。用户只需给出模糊的多步骤指令,模型自主规划、调用工具、检查结果、持续推进。在OSWorld-Verified电脑操作测试中拿下78.7%,几乎与Claude Opus 4.7持平,但在跨上下文推理和长周期任务追踪上拉开差距。Tau2-bench复杂客服工作流准确率98.0%——这意味着它能在不需要人类介入的情况下完成绝大多数标准化业务流程。
端到端编程闭环。与Codex深度集成后,GPT-5.5实现了"实现-重构-调试-测试-验证"全流程覆盖。Expert-SWE测试中,20小时长周期编程任务完成率73.1%,远超GPT-5.4的68.5%。更关键的是,它可以直接操作Web应用:点击页面、截屏迭代、生成电子表格和PPT。Cursor CEO评价:"GPT-5.5在推理和自主性上明显强于GPT-5.4和Claude Opus 4.7,能在不需要明确提示的情况下提前发现问题。"
科研辅助突破。GPT-5.5协助发现了拉姆齐数(Ramsey Numbers)的新证明,已用Lean语言验证。FrontierMath Tier 4前沿数学难题得分35.4%,比GPT-5.4提升8.3个百分点,是Claude Opus 4.7的1.55倍。BixBench生物信息学测试80.5%排名第一。
03 涨价一倍,但更便宜
GPT-5.5 API定价为输入每百万Token 5美元、输出30美元,比GPT-5.4贵了一倍。Pro版更高达输入30美元、输出180美元。表面看是涨价,但OpenAI的逻辑是:每个任务所需Token大幅减少,综合成本反而下降。
英伟达的实测数据支撑了这一说法。在GB200 NVL72系统上,GPT-5.5每百万Token成本降至前代的1/35,每兆瓦Token输出量提升50倍。OpenAI内部超85%员工每周使用Codex,财务团队用它审核了71,637页税务文件,提前2周完成;市场团队每周节省5-10小时。
但算账要看场景。对于简单的文本生成任务,GPT-5.4仍是性价比之选。GPT-5.5的价值在复杂Agent工作流中才能真正释放——而这也正是OpenAI想卖给你的:一个可以替代初级员工、独立完成端到端工作流的"数字打工人"。
04 更窄的战场
GPT-5.5发布背后,是OpenAI战略重心的根本性迁移。拥有9亿周活的ChatGPT不再是战略优先级,Codex才是。C端流量的广告变现路径不明朗且充满争议,B端企业为生产力工具的付费意愿已被验证无数次。
这是一个更窄但更值钱的战场。企业编码和Agent市场的客户付费能力强、切换成本高、合同周期长。但问题是,Anthropic已经在这个战场上建立了先发优势。GPT-5.5必须证明自己不只是"更强的模型",而是"更好用的同事"。
21世纪经济报道的评论一针见血:"更贵的模型,更窄的战场。"OpenAI用GPT-5.5在Anthropic最擅长的领域发起正面冲锋,这既是对市场份额下滑的焦虑回应,也是对AI商业化路径的主动选择。
05 4月的密度
2026年4月可能是AI历史上模型发布密度最高的月份。Claude Opus 4.7(4月16日)、Qwen3.6系列(4月21日)、DeepSeek-V4(4月23日)、GPT-5.5(4月23日),四大前沿模型在8天内相继登场。Kimi K2.6、GLM-5.1也在本月发布。
这种密度本身就是信号。大模型竞赛已经从"谁先到达下一个里程碑"变成了"谁能以更快的节奏持续到达"。发布周期从半年压缩到两个月,从模型能力竞争转向Agent生态竞争,从C端用户争夺转向B端客户锁定。
GPT-5.5不是终点,而是OpenAI对"AI怎么替人干活"这个问题的最新回答。下一次回答,可能不会等太久。
你更看好谁在企业Agent市场胜出?OpenAI的规模优势还是Anthropic的先发壁垒?欢迎留言讨论。