GPT-5.4炸场:原生控电脑,AI全面碾压人类
2026年3月6日,OpenAI深夜突袭发布旗舰模型GPT-5.4,一记王炸终结了Gemini 3.1 Pro和Claude Opus 4.6一个月的霸榜时代。这款实现「推理+编程」合流式跨越的模型,首次赋予ChatGPT原生电脑使用能力,在推理、视觉、工具调用、知识工作等所有维度拉满战力,不仅让AI操作电脑的熟练度超越人类,更以全维度无短板的表现,宣告OpenAI重回AGI赛道王座,也让职场人的未来迎来全新挑战。
原生控机成杀手锏,AI操作电脑比人更熟练
GPT-5.4最颠覆性的突破,在于成为OpenAI首个具备原生计算机使用能力的通用模型。它能通过Playwright库编写代码控机,也能直接识别屏幕截图、操控键鼠,像人类一样在软件和网页间穿梭,发邮件、排日程、填表格、跑流程等办公操作全自动化,彻底打通「思考-执行」的闭环。
在OSWorld-Verified电脑使用测试中,GPT-5.4以75.0%的成功率刷新SOTA,不仅大幅超越上一代GPT-5.2的47.3%,更碾压了人类的72.4%和此前登顶的Claude Opus 4.6的72.7%——AI操作电脑,正式比人类更熟练。在WebArena-Verified网页交互测试中,其67.3%的成功率也领先GPT-5.2,而仅靠截图观察的Online-Mind2Web测试中,更是拿下92.8%的断崖式高分。
这一切的背后,是GPT-5.4大幅升级的通用视觉感知能力。它首次引入「原始」「高」双图像输入细节级别,最高支持1024万总像素的全保真度感知,定位、图像理解、点击准确性全面提升。在MMMU-Pro视觉测试中,其81.2%的无工具成功率优于GPT-5.2的79.5%,文档解析能力也同步升级,OmniDocBench平均误差从0.140降至0.109,视觉能力成为所有执行功能的坚实基础。
全维度跑分炸裂,硬实力吊打竞品
GPT-5.4的恐怖,在于没有任何短板,每一项核心测试都登顶前列,全方位碾压Gemini 3.1 Pro和Claude Opus 4.6:
• 抽象推理:ARC-AGI-2跑出83.3%的新高,将Gemini 3.1 Pro的77.1%、Opus 4.6的68.8%远远甩在身后;
• 知识工作:GDPval基准测试83.0%胜率追平甚至超越顶尖人类专家,较GPT-5.2提升12个百分点,该测试覆盖美国9大核心行业、44种职业,从销售PPT到会计表格,AI交付的成果已优于多数专业人士;
• 专业建模:模拟初级投行分析师的电子表格测试中,87.3%的平均得分远超GPT-5.2的68.4%,68%的人类更偏好其生成的PPT,美感和实用性双优;
• 编程开发:继承GPT-5.3-Codex全部编程基因,SWE-Bench Pro测试57.7%准确率登顶,同时成为OpenAI迄今Token效率最高的推理模型,Codex/fast模式下生成速度提升1.5倍,延迟更低、成本更优;
• 网络搜索:BrowseComp测试中,Pro版本89.3%的成功率反超Claude Opus 4.6的84.0%,标准版也达82.7%,擅长多源头信息整合,「大海捞针」式查询也能精准作答;
• 工具使用:新增「工具搜索」功能,MCP Atlas测试中Token使用量狂砍47%,Toolathlon工具调用准确率54.6%,能顺畅完成「读邮件-提附件-评分-记录」全流程,τ²-bench电信客服任务更是达到98.9%的近乎完美成绩。
更值得一提的是,GPT-5.4将幻觉率降到了新低点——相较于GPT-5.2,单独声明出错概率降低33%,回复含错概率降低18%,成为OpenAI迄今为止最讲求事实的模型,真正能胜任专业工作场景。
体验与效率双升级,一个模型打通全链路
GPT-5.4不仅硬实力拉满,更在使用体验和效率上完成多重突破,让「通用智能体」成为现实。
它首次实现100万Token超长上下文,同时打通推理、编程、操控全链路,无需在「智能模型」和「编程模型」之间切换,一个模型搞定所有需求。针对复杂查询,GPT-5.4 Thinking版本支持中途介入引导,回复前梳理工作计划,过程中可随时调整方向,无需推倒重来,大幅节省沟通成本,且对对话历史步骤的记忆感知更强,深度思考能力升级。
开发者端更是福利拉满:GPT-5.4接入API与Codex,推出极速版/fast模式,还新增实验性「Playwright Interactive」技能,能一边构建Web应用、一边在浏览器中可视化调试。仅凭一段提示词,GPT-5.4就能打造出主题公园模拟游戏、回合制战棋RPG、金门大桥超写实3D飞行体验等完整应用,从功能开发到UI测试全自动化,前端开发能力实现质的飞跃。
定价创新高,AGI时代加速到来
伴随极致能力的,是GPT-5.4创新高的定价:标准版输入2.5美元/百万Token、输出15美元/百万Token,Pro版本更是达到输入30美元/百万Token、输出180美元/百万Token,有用户调侃一句简单的「嗨」就让GPT-5.4 Pro思考5分18秒,花费80美元。
但高定价背后,是无可替代的核心价值。正如OpenAI团队所言,GPT-5.4在计算机应用和经济价值任务上迈出了关键一步,目前看不到能力瓶颈,2026年AI能力将持续大幅提升。从「能思考」到「能动手」,GPT-5.4让AI真正从「对话助手」进化为「全能工作伙伴」,不仅重构了AI行业的竞争格局,更让办公场景迎来颠覆性变革——那些依赖重复操作、数据处理、文档制作的工作,正被AI快速替代。
被Gemini和Claude压制一个月后,OpenAI用GPT-5.4完成了漂亮的反击。这款全维度无短板的模型,不仅重新定义了通用人工智能的天花板,更让全世界看到:AGI的大门,正在被逐步推开。而对于每一个打工人而言,真正的挑战已经到来——未来的职场,不再是人与AI的竞争,而是会用AI的人,与不会用AI的人的竞争。
元宇宙与人工智能三十人论坛
因微信公众号整改,没有加“星标⭐️ ”的订阅号有时无法收到消息
1.为防止错过最新资讯,请将元宇宙与人工智能三十人论坛设为星标⭐️
2.点击“赞”和“在看”,提高我们相遇的几率。
3.精彩文章,请点击文末左下角“分享”给好友。
了解更多关注