提醒: Claude Fable 被越狱会很危险
Anthropic 在 2026 年 6 月 9 日 (美国时间) 这个深夜, 同时发布了两个模型。
但它只让你用其中一个。
另一个叫 Claude Mythos 5, 据 Anthropic 自己说"太强不能给所有人", 所以锁进了一个叫 Project Glasswing 的项目里, 只有大约 200 家经过审查的组织 (苹果、亚马逊、谷歌、微软、英伟达、摩根大通、Linux 基金会、Palo Alto Networks 这些) 能用。
你能用的那个叫 Claude Fable 5。Anthropic 在博客里这样描述它和 Mythos 5 的关系: "Fable 5 采用与 Mythos 相同级别的技术, 但由于受到安全防护和限制, 所以可以安全供公众使用。"
翻译成大白话: 同一代能力的模型, 我做了两个, 一个原版给信得过的人, 一个阉割了高风险能力的版本给所有人。
解读如下, 欢迎订阅视频号:
这件事在大模型发布史上几乎没人这么完整地干过。OpenAI 一个月前 (5 月 8 日) 走过半步 — 在 GPT-5.5 之外单独推出 GPT-5.5-Cyber 受控预览版, 只给经过审核的网络安全团队用, 同时还做了"通用 / Trusted Access / Cyber 红队"的三层访问分级。但 OpenAI 是把"高风险版本"做成一个独立的预览模型, 走的是"再发一个"的路径; Anthropic 这次是同步双 SKU + 在公开版内置自动降级路由, 走的是"一次发两个, 主版本自带分级开关"的更激进路径。Google、Meta 至今没有类似动作。
所以我想跟你认真聊聊 Fable 5 — 它不只是一个新模型, 它是一次产品哲学的实验。这次实验赌的是: 在 AI 能力变得足够强、足够危险的时候, 公司是不是有办法既不停止商业化, 又能履行自己说过的安全承诺。而且这条路 Anthropic 不是孤身在走, OpenAI 早一步已经在试。
接下来我会从四个完全不同的角度来看这件事 — 从模型本身看强不强、从治理角度看新不新、从商业角度看划不划算、从我自己作为天天用 AI 写代码的人看值不值。这四个角度互相打架, 但合起来就是 Fable 5 的全貌。
这个 "Mythos 级" 到底意味着什么
先把最容易被营销话术蒙过去的事讲清楚。
站在一个写过 evaluation 又跑过基准的模型研究员角度, 我会先问一句: "Mythos 级"是 Anthropic 自创的命名, 还是真的对应某个具体的能力门槛?
这一点 Anthropic 其实早在两个月前就给出了答案。2026 年 4 月, Mythos Preview 在一个叫 OSS-Fuzz 的开源软件模糊测试基准上跑了 7000 个入口点 — 这是个软件安全圈的标准测试场。结果是: Mythos Preview 在 10 个完全打补丁的目标上, 实现了五级严重度阶梯里最高的 tier-5, 也就是 完全控制流劫持 (能从让程序崩溃这种小事, 一路推到让程序按攻击者的意图执行任意代码)。同期的 Claude Opus 4.6 / Sonnet 基本只能做到 tier-1/2 — 让程序崩溃就是上限了。
这是一种从"哎呀程序挂了"到"我已经悄悄接管了你的服务器"的本质区别。打个不那么严谨的比方: 之前的 AI 能告诉你这个锁可能有问题, Mythos 是直接把锁撬开然后告诉你它怎么撬的。
更直接的数字: 网络安全漏洞复现基准上, Mythos Preview 拿了 83.1%, Opus 4.6 是 66.6%, 差了 16.5 个百分点。在前沿模型这个级别上, 这是大跨度的能力代差。
所以 "Mythos 级" 不是营销话术, 它对应一个具体的、可验证的能力门槛 — 而且高到让 Anthropic 自己都不敢把原版公开。 Fable 5 是"Mythos 5 减去网络安全 / 生物 / 化学能力"的版本, 不是"Opus 4.8 加点料"的下一个 4.9 版本。如果你之前听到 "Mythos 级" 觉得这是又一个吹牛的新词, 你可以放下这个怀疑了。
但代际能力不等于代际价值。能力强是一回事, 在你真实使用场景里能不能兑现是另一回事。我后面会回到这个问题。
为什么要拆成两个发: 一次 RSP 框架的工业级落地
现在切换一下视角, 从治理学者的眼睛看这次发布。
Anthropic 有一份叫 Responsible Scaling Policy (RSP, 负责任扩展策略) 的文件, 2023 年首次发布, 定义了一套 AI 安全等级系统 (ASL): ASL-1 是无风险 (下棋 AI), ASL-2 是有早期危险能力迹象 (现在的大部分大模型), ASL-3 是 "相比搜索引擎、教科书等非 AI 基线, 大幅增加灾难性滥用风险, 或显示出低级自主能力", ASL-4 是接近人类级自主、可能成为全球安全威胁主要来源。
Mythos 在 OSS-Fuzz 上达到的能力 — 自动发现并利用未知漏洞 — 在 Anthropic 的内部评估里, 大概率已经触达 ASL-3 的门槛。ASL-3 一旦触发, 按 RSP 的承诺, Anthropic 应该实施部署限制。 但同时, Anthropic 是一家年化营收 470 亿美元、即将在 2026 Q2 实现首次盈利的公司, 它不能简单地"按下不发布"。
这就是为什么会有 Fable + Mythos 双 SKU。
这是 RSP 类框架从政策文件被推进到产品矩阵的最激进一次。 前面说过, OpenAI 一个月前的 GPT-5.5-Cyber 也走了类似方向, 但 OpenAI 是"主模型 + 一个受控预览模型"的两个独立 SKU; Anthropic 这次是同步双 SKU + 在公开版内嵌实时路由屏蔽, 把"分级访问"从访问控制层下沉到了模型推理层。之前所有"负责任发布"的承诺都停留在"我们慢点发"或"我们部分发", Anthropic 这次是"我们发两个, 一个给你, 一个给信得过的人, 给你的那个在敏感领域自动降级"。
那个"自动降级"机制, 是这次发布最容易被忽略但最重要的工程细节: 当你在 Fable 5 里问到涉及网络安全、生物学、化学的敏感问题时, 它会自动切换到能力较弱、但安全围栏更成熟的 Claude Opus 4.8 来回答你。Anthropic 在博客里直接承认了: "对于网络安全专家和生物学研究人员来说有益的查询, 如果落入恶意行为者手中, 可能会造成危险。"
这件事的工作流程, 我画给你看:
这张图想说的是: 一次 query 在你看不见的地方, 会被分流到不同能力的模型上。普通市场拿到的是 Fable 5 (蓝色框) — 完整能力, 但对三个敏感领域装了"自动降级"开关。Project Glasswing 那 200 家可信组织拿到的是 Mythos 5 (红色框) — 完整能力, 没有降级。
站在治理研究员的角度, 我看到的是一次工程上更激进的实验: Anthropic 把 RSP 这份政策文件, 用产品矩阵 + 推理时路由的方式具象化了。但它不是孤例, 也不是先行者 — OpenAI 5 月初已经用 GPT-5.5-Cyber 走过类似一步, 而且更早向欧盟监管机构开放了访问权限 (Anthropic Mythos 至今未对欧盟开放)。如果这场实验成功 (没出大事、其他实验室继续跟进、监管认可), "能力分级 + 受控访问" 会成为前沿 AI 发布的事实标配。如果失败 (公开越狱让 Fable 5 给出 Mythos 级答案、Glasswing 内部出现滥用、自动降级机制被证明无效), 它会变成一次工程上的奢侈实验, 但行业整体还是会朝"分级发布"的方向走。
最让我心里悬一下的是: 这套机制完全是 Anthropic 自己评估、自己执行的, 没有任何外部审计。 在 2026 年这个时间点, 中、美、欧的前沿模型审计制度都还没成型 — Anthropic 既是裁判又是运动员。这不是说他们不诚实, 而是说哪怕他们诚实, 这种机制也缺乏外部可信度。这是我对整个安排最大的保留意见。
50 这个价钱背后, 是一次 IPO 路演
切换到第三个角度: 看 AI 公司估值看了 15 年的二级市场分析师视角。
Fable 5 的定价是: 输入 $10/M tokens, 输出 $50/M tokens, 提示词缓存最高降 90% 输入成本。
参照系有两层:
同门: Claude Opus 4.8 (Anthropic 当前在产旗舰, 5 月 29 日发布, 替代了 4.7) Standard 价格 25, 但它有个 Fast Mode 价位 50 — 这恰好就是 Fable 5 的价格。也就是说 Fable 5 接管的不是 Opus 4.8 的"主价位", 而是"高速版"的那条价格线。Sonnet 4.6 是 15, Haiku 4.5 更便宜。 对手: GPT-5.5 是 30 (2026-04-23 发布), 主打 agent 编程和长任务, 跟 Fable 5 的定位几乎重合; Gemini 3.1 Pro 是 Opus 4.6 一半不到的价格, 16 项主流基准里赢了 13 项 (2026-02-20 发布)。
把这两层放一起看: Fable 5 的 50, 是同门高速档的接续, 但相对外部竞品贵了 50% 到一倍多。这不是单纯的提价, 是 Anthropic 主动选择"高端 + 受控"路线、把价格敏感的市场让给 OpenAI 和 Google。
这不是一个小动作, 这是 Anthropic 商业模型的一次拐点。
要理解这次拐点, 你得先看 Anthropic 的营收曲线。一年半前 (2025 年 3 月), Anthropic 年化营收 14 亿美元、估值 615 亿美元, 那时候它的核心卖点是 "OpenAI 的安全替代品" — 对那些害怕模型出错的金融、医药、法律、政府客户来说, Anthropic 提供"政治正确"的安全感。
到 2026 年 5 月, 年化营收飙到 470 亿美元, 估值 9650 亿美元 (接近 1 万亿), 财富 500 前 10 中已经有 8 家是它的客户。预计 2026 Q2 (也就是这个季度) 实现首次盈利, Q2 营收 109 亿、营业利润 5.59 亿。按这个节奏, IPO 的窗口大概率在 2027 年。
问题来了: 当你把客户金字塔顶部 80% 都收割完之后, 下一步靠什么继续增长?
答案有三个: 让现有客户花更多钱 (高端化)、扩大客户基数到中型企业 (产品矩阵)、攻入新的高价值场景 (软件工程 + agentic)。Fable 5 一次性把三条都押上 — 高定价拉 ARPU, 与 Sonnet/Opus/Haiku 形成产品矩阵, 主打 long-horizon agentic 任务。
更关键的是, Anthropic 必须把自己的估值叙事从"安全替代品"升级成"安全 + 能力双护城河"。 615 亿估值可以靠"安全标签", 9650 亿不能。Fable 5 必须让市场相信: 这家公司能在能力维度上压住已经先发的 GPT-5.5、比它价格更低的 Gemini 3.1 Pro、以及即将到来的 GPT-5.6 — 不是"等竞争对手出招", 而是"在三家同时在场的局面下, 我比谁都贵, 也比谁都值"。
所以从这个角度看, 这次发布与其说是产品发布, 不如说是 IPO 之前的 能力声明 + 估值锚定。"Mythos 级"是给资本市场看的能力旗帜, 50 是给资本市场看的提价能力, Project Glasswing 是给资本市场看的护城河形态, Q2 首次盈利是给资本市场看的财务节奏。
而 Project Glasswing 这件事, 我想专门说一下 — 它在治理学者眼里是治理创新, 但在我这个商业分析师眼里, 它是一个非常聪明的双重护城河。Anthropic 拿出 1 亿美元的 Mythos 使用积分 + 400 万美元直接捐赠, 把 AWS、苹果、思科、CrowdStrike、谷歌、摩根大通、Linux 基金会、微软、英伟达、Palo Alto Networks 这种关键基础设施厂商深度绑在一起。这意味着: (a) 当未来监管要求"前沿模型必须经过审查发布"时, Anthropic 已经有现成机制; (b) 这 12 家科技巨头同时是 Anthropic 在云平台、企业销售、政府关系上的盟友。它把"治理创新"和"商业护城河"做成了同一件事 — 这才是最强的商业模型。
但这套叙事不是没有风险。最大的风险不在未来, 就在当下: GPT-5.5 早在 4 月 23 日就已经发布, 定价 30, 主打 agent 编程和长任务, 5 月 6 日 Instant 版还面向全体 ChatGPT 用户免费开放。Gemini 3.1 Pro 2 月就已经上线, 在 16 项主流测试里赢了 13 项, 价格只有 Claude Opus 4.6 的一半不到。Fable 5 50 的定价, 已经被这两家公司同时压在头上。更尴尬的是, OpenAI 还有 GPT-5.6 即将在 6 月发布 (内部代号 iris-alpha, 据曝光支持 150 万 token 上下文)。所以 Anthropic 这次的真考验不是"等竞争对手出招", 而是"出招的人已经在你前面了, 你的高定价怎么解释"。
但你, 作为天天用它的人, 该怎么用
切换到最后一个视角 — 这也是我自己每天的视角 — 写代码的人。
我的反应特别简单, 简单到我自己都觉得反高潮: Fable 5 对我大部分工作没用, 对一小部分工作可能很有用, 但我得先实测才能知道。
我把自己每天的任务分成四类:
类型 A — 简单代码 (写函数、修 typo、加测试)。Sonnet 4.6 完全够用, 单次任务几分钱, 切 Fable 5 就是浪费。 类型 B — 中等复杂 (PR review、单文件 refactor、debug)。Opus 4.8 就行, Fable 5 提升有限但价钱翻倍, 不划算。 类型 C — 长链条任务 (跨文件 refactor、新功能全栈实现、复杂多步骤 agent)。这里才是 Fable 5 的真正卖点 — 单次任务可能消耗几百万 tokens、几十美元, 但如果能帮我从"陪 agent 跑一晚上 + 早上改一两小时"变成"早上看完结果", 那一周省 3-5 小时, 月省 12-20 小时, 完全覆盖 API 成本。 类型 D — 触发敏感词 (在写网络安全工具、研究漏洞、聊生化)。Fable 5 会自动降级到 Opus 4.8, 不如我直接用 Opus 4.8 — 至少我知道我在跟谁说话。
这里隐藏着 Fable 5 对开发者最隐蔽的一个问题: 黑盒路由。当我的某个 query 被悄悄降级到 Opus 4.8 时, 如果 API 响应里没有明确告诉我 "this query was routed to opus-4.8 due to safety policy", 我可能突然发现 "这次输出怎么这么差", 但不知道为什么。对工程系统来说, 不透明的路由是反 pattern。我个人会等 Anthropic 把这件事在 API 层面做透明之后, 才考虑在生产环境里用 Fable 5。
对独立开发者: 你大概率用不起 Fable 5, 也用不到 Fable 5。Sonnet 4.6 + 偶尔切 Opus 4.8 就够了。Pro/Max 免费试用到 6 月 22 日, 想尝鲜的话趁这段时间。
对企业团队: 值得让 1-2 个工程师做 1-2 周 pilot, 在你自家代码库上对比 Fable 5 vs Opus 4.8 在长链条任务上的真实成功率。如果成功率提升 5-8 个百分点以上, 就推广; 否则继续用 Opus 4.8。
对完全没写过代码的普通人: 这事跟你直接关系不大。Anthropic 的 claude.ai 网站上现在能用 Fable 5 (在 Pro/Max 订阅里), 但你在日常聊天里大概率感受不到它和 Sonnet 4.6 / Opus 4.8 的差别 — Fable 5 的优势是长任务, 不是聊天质量。
未来我自己最关心的2件事是 7 月底 Claude Code 接入的工程化质量 和 6 月底 GPT-5.6 出来后的实测对比。前者决定 Fable 5 能不能从 demo 走进我的日常工作流, 后者决定 Anthropic 的高定价在三家同时在场 (GPT-5.5/5.6、Gemini 3.1 Pro、Fable 5) 的格局下还站不站得住。其他的, 都次要。