ITPUB

能查漏,还能亲手补!OpenAI 发布 GPT-5.5-Cyber,超越Mythos 5

Image

一场围绕“AI+安全”的军备竞赛,已经全面打响。

过去一年,大模型公司忙于比拼编程、搜索和Agent。但现在,一个新的战略高地正在浮出水面——网络安全。这不仅是技术的延伸,更是对AI能力的终极考验:当模型不仅会写代码,还能在一套复杂的真实系统中找到隐藏的薄弱点,并亲手修复它,AI才真正从“工具”走向了“防御者”。
Image

6月22日,OpenAI正式宣布扩展Daybreak安全计划,核心是推出GPT-5.5-Cyber的“满血版”模型、Codex Security插件,以及一项面向开源生态的“Patch the Planet(修补星球)”计划。这一动作被普遍视为对Anthropic此前推出Mythos安全系列模型的直接回应——一场围绕“AI+安全”的军备竞赛,已经全面打响。

“满血版”的含金量:不只是少拒绝,而是能真正干活

今年5月,OpenAI首次向部分研究人员开放GPT-5.5-Cyber预览版,当时的核心目标是减少模型对专业安全任务的过度拒绝。而此次发布的“满血版”,能力实现了质的跃升。

根据官方数据,在CyberGym基准测试中,更新后的GPT-5.5-Cyber单模型得分达到85.6%,显著高于GPT-5.5通用版本的81.8%,创下该测试单模型的最高分纪录,这一成绩也超过了 Anthropic Mythos 5 的 83.8%。在更苛刻的ExploitGym漏洞利用测试中,GPT-5.5-Cyber得分飙升至39.5%,较GPT-5.5的25.95%有大幅提升;在SEC-bench Pro安全基准上也达到了69.8%,优于前代的63.1%。

但OpenAI强调,真正衡量模型价值的不是跑分,而是实战能力。在真实环境中,GPT-5.5-Cyber能够完成从漏洞发现到修复验证的完整闭环:对大型代码库进行深度分析、识别安全相关的代码组件、判断漏洞的可利用性、在受控环境中验证、生成修复补丁,并整理证据供人工审查。

换言之,它不再是只会报错的“告警器”,而是一名能参与完整安全开发流程的 “AI安全工程师” 。早期Daybreak项目已借助GPT-5.5和Codex Security在Firefox、V8、Safari、OpenBSD、FreeBSD及HTTP/2等广泛使用的软件中成功发现并验证安全漏洞。

从“找Bug”到“修Bug”:Patch the Planet计划解决开源世界的真实痛点

AI辅助漏洞挖掘已不新鲜,但它带来一个副作用:安全报告井喷,真假难辨,开源维护者不堪重负。许多支撑互联网基础设施的关键项目,核心维护者常年不足十人,面对海量告警,根本无力逐一验证。

OpenAI联合Trail of Bits发起、并与HackerOne等平台合作的“Patch the Planet”计划,正是要解决这个“最后一公里”难题。其核心理念不是丢一堆AI报告给维护者,而是由安全研究员主导,AI辅助筛选、去重、验证,并先生成可用的修复补丁**,再交由维护者最终确认。

这种“人工把关、AI干活”的模式,显著降低了开源维护者的负担。在早期试点中,该计划仅用几天就发现数百个潜在问题,合并数十个修复补丁,并建立了一套可复用的自动化测试流程。

目前,已有超过30个开源项目承诺参与,首批名单包括 cURL、Go、Python、Sigstore和pyca/cryptography 等关键基础设施。参与项目还可获得ChatGPT Pro、Codex Security权限及API额度支持。

双雄对决:AI安全能力的“平衡木”难题

OpenAI与Anthropic的这场新竞赛,背后有一个更深层的共识:前沿大模型已具备较强的漏洞分析和利用能力,甚至能辅助构造攻击代码。 这意味着,同样的能力既是防御利器,也是攻击武器。

因此,OpenAI并未完全开放GPT-5.5-Cyber的访问权限,而是面向经过严格验证的安全人员,并配套更严格的监控与权限控制。同时,通过启动Daybreak Cyber Partner Program,OpenAI选择与安全厂商合作,将能力间接输出给企业客户,而非直接提供模型接口。

Anthropic的Mythos走的是类似路径,双方都在探索同一道难题:如何在赋能防御方与防止滥用之间,找到那个危险的平衡点。

可以预见,2026年下半年,AI在网络安全领域的竞争将不再停留在“谁能发现更多漏洞”,而是谁能更可靠、更负责任地完成从发现到修复的完整防御闭环。在这个战场上,大模型不仅要证明自己的智商,更要证明自己的“安全情商”。

Image