findyi

Claude最强模型fable5震撼发布

前几天Anthropic 干了一件大事,发布了fable5。

先说结论:

Anthropic在2026年6月9日,用一张官方对比表,把GPT 5.5、Gemini 3.1 Pro、自家的Opus 4.8 全部打成了"对照组"。

Claude Fable 5(民用版)和Mythos5(受限版),在15项核心 benchmark 上拿下 13 项第一,剩下 2 项的"输"也是输给自家测试版。

一、Anthropic 用一张表,把所有竞争对手打成"对照组"

我把它的关键数据拉出来,你立刻就懂这件事有多狠:

测试项
Fable 5 / Mythos 5
GPT 5.5
Gemini 3.1 Pro
SWE-Bench Pro(软件工程)
80.3%
58.6%
54.2%
FrontierCode(顶级工程任务)
29.3%
5.7%
—
Terminal-Bench 2.1(终端编程)
88.0%
83.4%(Codex CLI)
70.7%
Legal Agent(法律 AI)
13.3%
2.1%
0.0%
GDPval-AA(知识工作综合)
1932
1769
1314
Humanity's Last Exam(综合推理)
59.0%
41.4%
44.4%
ExploitBench(网络安全)
78.0%
34.0%
—
HealthBench(专业健康)
66.0%
51.8%
—

13项第一,2 项平手(输给自家 Mythos Preview),0项失败。

意思是:Anthropic 这次发布,对外部所有模型,全胜。

这是过去 3 年 AI 模型迭代史上,第一次出现的"全面碾压"对比。

二、6个重要的冲击数据

我把这张表里最有冲击力的6个数据单独拎出来。

数据 1:FrontierCode 5倍领先

Fable 5 的 29.3% vs GPT 5.5 的 5.7%。

FrontierCode 是测试模型能不能完成"高质量生产级代码任务"的终极评测。

5倍差距意味着:Fable 5 能干的工程活,GPT 5.5 根本干不了。

数据 2:Terminal-Bench直接打过 Codex CLI

Fable 5:88.0%。Codex CLI:83.4%。

这是 OpenAI 自家最强编程产品 Codex 第一次在公开 benchmark 上被超越。

数据 3:Legal Agent · Gemini 3.1 Pro 是 0 分

模型
Legal Agent Benchmark
Fable 5
13.3%
Opus 4.8
10.4%
GPT 5.5
2.1%
Gemini 3.1 Pro0.0%

Gemini 在法律 Agent 上拿了零分。

而Fable5拿了13.3%。

这个数据的含义:如果你做 AI 法律咨询小程序、AI 律师助手、AI 合同审查Claude 系是唯一选择,其他就是空气了。

数据 4:知识工作综合分类,把 Gemini 甩开 47%

GDPval-AA:Fable 5 的 1932 对比之前的王者Gemini 1314。

想做"知识工作 + AI"的方向(咨询/培训/分析/写作),底层模型选择已经没悬念了。

数据 5:网络安全 · Fable 5 是 Opus 4.8 的 2 倍

ExploitBench:Fable 5 的 78% vs Opus 4.8 的 40%。

这就是为什么 Anthropic这次把 Fable 5 拆成两个版本:完整能力的 Mythos 5只给美国政府和受信任的安全合作方。

民用版 Fable 5在敏感问题上会自动降级到Opus 4.8 回答。

Anthropic 第一次明确把"国家安全级 AI"和"普通商业级 AI"分开发布。

这是AI产品策略的范式重置。

数据 6:综合推理 HLE,离博士级别只差一步

Humanity's Last Exam 无工具:Fable 5 的 59.0%对比Gemini 的 44.4%。

HLE 是号称"人类终极考试"的最难推理测试。

59% 意味着Fable 5 在跨学科深度推理上,接近人类博士水平。

三、Fable5这件事对普通人是真红利

AI 已经从"工具时代"进入"工程师和工程团队时代"。

最近Stripe 用 Fable 5,在 5000 万行 Ruby 代码库里,1 天完成了过去 50人团队2 个月才能做完的全代码库迁移。

这是 Anthropic 官方公布的真实案例。

如果没有Fable5,Stipe估计还不知道怎么开启这个艰巨的任务。

如果你是普通人,你会问:跟我有什么关系?

答案是AI一旦突破"独立工程师"门槛,所有依赖工程师的事都被重写了。

包括:

1/你想做的小程序,1天就能做出来(不是两周)
2/你想做的 SaaS 产品,1周就能跑通 MVP(不是1个月)
3/你想做的网站,几小时就能上线(不是几天)
4/你想做的工具,提个需求就能拿到完整产品(不是先学半年代码)

这就是"开发门槛"被彻底拆掉的真实场景。

四、写在最后的话

回到那句老话:实战差和认知差不会一直在。

每一次AI工具级别的跃迁,都创造了一批AI工具红利的吃肉者,但前提是率先入局。

AI工具的本质是让人人都能成为创作者的时代,真正到来。

如果大家也想吃到AI和AI编程这波红利,恰好破局研发了AI小程序课程,大家可以扫码直接学课程,并且还可以参加我们的三天AI直播课,拿到一套AI编程课程,拿到N套AI课程:

图片