程序员老鬼

AI 大战!Claude Opus 4.6和GPT-5.3 Codex同时发布,真神仙打架!

家人们,AI圈又迎来大事件啦!在全网苦苦等待两天后,凌晨2点,Anthropic的新模型Claude Opus 4.6正式更新

Image

本以为这就够让人激动了,谁能想到20分钟后,OpenAI也扔出“王炸”——GPT 5.3 Codex震撼登场,这简直就是“中门对狙”,直接把AI圈的氛围拉满,我这个熬夜党更是困到不行,但又被硬生生“拽”在屏幕前😫。

Image

我平时常用GPT - 5.2做搜索、事实核查、研究和编程改BUG,用Opus 4.5进行创作和主力编程,现在这两个模型都迎来更新,必须好好研究一番。

先说说Claude Opus 4.6,Anthropic这次不止发布了新模型,还有Agent Teams和Excel、PPT插件更新。

跑分上,Opus 4.6相当漂亮。Terminal - Bench 2.0测试中,它以65.4%的成绩成为所有模型里最高的(当时还没看到GPT - 5.3 codex),GPT - 5.2是64.7%,Gemini 3 Pro是56.2%。

OSWorld评估里,它拿到72.7%,比前代Opus 4.5的66.3%提升不少,意味着它操作电脑更厉害,能更好地操作鼠标、切换应用。

BrowseComp评估中,它以84.0%远超其他模型,第二名GPT - 5.2 Pro是77.9%。GDPval - AA评估里,它拿下1606的Elo分,比GPT - 5.2高144分,比前代高190分,在真实工作任务中表现出色。ARC AGI 2测试中,它取得68.8%,能力惊人。

Image

产品层面,升级也很给力。它终于支持1M token的上下文窗口,之前只有200K,整整翻了5倍,而且在大上下文下表现稳定,在大海捞针类测试中表现出色。输出上限提升到128K,对于实际使用很关键。

Context Compaction功能可自动压缩旧对话内容,避免上下文溢出中断任务。Adaptive Thinking和Effort控制让用户能在速度、成本、质量间找到平衡。

Agent Teams功能让多个“团队成员”可独立工作、相互沟通协作,比之前的子代理更强大。此外,Claude in Excel和Claude in PowerPoint插件也进行了更新,集成度更高,功能更强大。

价格方面,API价格不变,特定情况有额外定价,目前网页版和Claude Code均已上线。

Image

再看看GPT - 5.3 Codex,OpenAI称这是首个在创造自己的过程中发挥重要作用的模型,AI参与了自身开发,这听起来就很科幻,但也意味着AI进化速度可能加快。跑分上,在Terminal - Bench 2.0基准里,它以77.3%领先Claude Opus 4.6的65.4% 11.9个百分点。

不过,两家评测基准有差异,部分跑分难以直接对比。但GPT - 5.3 Codex在SWE - bench Pro Public测试中,面对更复杂的多语言基准也能有不错表现,还自主迭代做出了完整的可玩游戏,而且在工作时能和用户互动,用户可随时介入调整方向,运行速度也更快。

总的来说,现在的模型都在朝着Coding和Agent方向快速进步,两家头部AI公司同一天发布大招,差距在缩小,都在押注Agent但侧重点不同。

传统SaaS公司感受到压力,软件行业正经历重大范式转变。我之后打算继续用Claude Opus 4.6 + Claude code打草稿,GPT - 5.3 Codex + Codex进行后续精准开发。

现在绝对是关注和学习AI的好时期,大家也别错过,赶紧试试这些新模型吧!