Claude最强模型fable5震撼发布
前几天Anthropic 干了一件大事,发布了fable5。
先说结论:
Anthropic在2026年6月9日,用一张官方对比表,把GPT 5.5、Gemini 3.1 Pro、自家的Opus 4.8 全部打成了"对照组"。
Claude Fable 5(民用版)和Mythos5(受限版),在15项核心 benchmark 上拿下 13 项第一,剩下 2 项的"输"也是输给自家测试版。
一、Anthropic 用一张表,把所有竞争对手打成"对照组"
我把它的关键数据拉出来,你立刻就懂这件事有多狠:
| 80.3% | |||
| 29.3% | |||
| 88.0% | |||
| 13.3% | 0.0% | ||
| 1932 | |||
| 59.0% | |||
| 78.0% | |||
| 66.0% |
13项第一,2 项平手(输给自家 Mythos Preview),0项失败。
意思是:Anthropic 这次发布,对外部所有模型,全胜。
这是过去 3 年 AI 模型迭代史上,第一次出现的"全面碾压"对比。
二、6个重要的冲击数据
我把这张表里最有冲击力的6个数据单独拎出来。
数据 1:FrontierCode 5倍领先
Fable 5 的 29.3% vs GPT 5.5 的 5.7%。
FrontierCode 是测试模型能不能完成"高质量生产级代码任务"的终极评测。
5倍差距意味着:Fable 5 能干的工程活,GPT 5.5 根本干不了。
数据 2:Terminal-Bench直接打过 Codex CLI
Fable 5:88.0%。Codex CLI:83.4%。
这是 OpenAI 自家最强编程产品 Codex 第一次在公开 benchmark 上被超越。
数据 3:Legal Agent · Gemini 3.1 Pro 是 0 分
| Gemini 3.1 Pro | 0.0% |
Gemini 在法律 Agent 上拿了零分。
而Fable5拿了13.3%。
这个数据的含义:如果你做 AI 法律咨询小程序、AI 律师助手、AI 合同审查Claude 系是唯一选择,其他就是空气了。
数据 4:知识工作综合分类,把 Gemini 甩开 47%
GDPval-AA:Fable 5 的 1932 对比之前的王者Gemini 1314。
想做"知识工作 + AI"的方向(咨询/培训/分析/写作),底层模型选择已经没悬念了。
数据 5:网络安全 · Fable 5 是 Opus 4.8 的 2 倍
ExploitBench:Fable 5 的 78% vs Opus 4.8 的 40%。
这就是为什么 Anthropic这次把 Fable 5 拆成两个版本:完整能力的 Mythos 5只给美国政府和受信任的安全合作方。
民用版 Fable 5在敏感问题上会自动降级到Opus 4.8 回答。
Anthropic 第一次明确把"国家安全级 AI"和"普通商业级 AI"分开发布。
这是AI产品策略的范式重置。
数据 6:综合推理 HLE,离博士级别只差一步
Humanity's Last Exam 无工具:Fable 5 的 59.0%对比Gemini 的 44.4%。
HLE 是号称"人类终极考试"的最难推理测试。
59% 意味着Fable 5 在跨学科深度推理上,接近人类博士水平。
三、Fable5这件事对普通人是真红利
AI 已经从"工具时代"进入"工程师和工程团队时代"。
最近Stripe 用 Fable 5,在 5000 万行 Ruby 代码库里,1 天完成了过去 50人团队2 个月才能做完的全代码库迁移。
这是 Anthropic 官方公布的真实案例。
如果没有Fable5,Stipe估计还不知道怎么开启这个艰巨的任务。
如果你是普通人,你会问:跟我有什么关系?
答案是AI一旦突破"独立工程师"门槛,所有依赖工程师的事都被重写了。
包括:
1/你想做的小程序,1天就能做出来(不是两周)
2/你想做的 SaaS 产品,1周就能跑通 MVP(不是1个月)
3/你想做的网站,几小时就能上线(不是几天)
4/你想做的工具,提个需求就能拿到完整产品(不是先学半年代码)
这就是"开发门槛"被彻底拆掉的真实场景。
四、写在最后的话
回到那句老话:实战差和认知差不会一直在。
每一次AI工具级别的跃迁,都创造了一批AI工具红利的吃肉者,但前提是率先入局。
AI工具的本质是让人人都能成为创作者的时代,真正到来。
如果大家也想吃到AI和AI编程这波红利,恰好破局研发了AI小程序课程,大家可以扫码直接学课程,并且还可以参加我们的三天AI直播课,拿到一套AI编程课程,拿到N套AI课程: