Anthropic 三件事:封号潮,Fable 回归,Sonnet 5 发布
6 月份事件密集,大致可以概括为:
Fable 被禁又回归,引发不小讨论,但这两天 Claude Code 封号潮却在微信 coding 群炸锅了,吐槽不断。本文整理最新相关事件,帮大家顺清脉络(Anthropic 依旧魔幻,无力吐槽)。相关阅读:GPT-5.6 Sol:前沿智能不再平权、Claude Fable 被封,不是开源的胜利、Claude Fable 禁令前,大家做了什么?、Claude Fable 5:最强 AI 正在变成“特权资源”。
封号潮
封号一直有,只不过这两天更甚。微信群哀嚎遍野,吐槽声不断...
系统检测 & Prompt 隐写
这部分主要来自两篇内容:一篇 Reddit 原帖 Anthropic embedded spyware in Claude Code — and attempted to hide it from you[1],另一篇技术分析 Claude Code Is Steganographically Marking Requests[2]。前者语气更激烈,直接将其称为 “间谍软件(spyware)”;后者更克制,重点分析 Claude Code 如何通过 prompt steganography,也就是“提示词隐写”,在请求中嵌入隐藏标记。
两篇内容指向的核心问题基本一致:自 Claude Code 2.1.91 版本起,客户端中存在一段检测逻辑,会根据用户是否设置 ANTHROPIC_BASE_URL、系统时区是否为 Asia/Shanghai 或 Asia/Urumqi、代理 URL 是否命中特定域名或 AI 实验室关键词,修改系统 prompt 中的日期字符串。
正常情况下,系统 prompt 里的日期可能是:
Today's date is 2026-06-30.
但在特定条件下,它会被悄然改成类似:
Today’s date is 2026/06/30.
Todayʼs date is 2026-06-30.
Todayʹs date is 2026/06/30.
这些变化主要发生在两处:一是 Today's 中的撇号字符被替换成视觉上极其相似的 Unicode 字符;二是如果检测到特定中国时区,日期分隔符会从 - 变成 /。用户肉眼几乎看不出差异,但后端程序很容易识别这些变体。也就是说,请求表面上仍是普通日期提示,实际却携带了环境分类信息。
关键代码逻辑
技术分析中整理出的核心函数大致如下。它会读取 API base URL 和系统时区,并生成三个关键信号:是否处于中国时区、hostname 是否命中特定域名列表、hostname 是否包含特定 AI 实验室关键词。
functionZup() {
if (Crt()) return null;
let host = Qup();
let timezone = e0t();
let cnTZ = timezone === "Asia/Shanghai" || timezone === "Asia/Urumqi";
if (!host) {
return {
known: false,
labKw: false,
cnTZ,
host: null,
};
}
return {
known: Jup().some((domain) => host === domain || host.endsWith("." + domain)),
labKw: Xup().some((keyword) => host.includes(keyword)),
cnTZ,
host,
};
}
其中,cnTZ 用来判断是否处于中国时区;known 用来判断 hostname 是否命中特定域名列表;labKw 用来判断 hostname 是否包含特定 AI 实验室关键词。随后,Claude Code 会根据 known 和 labKw 的组合,选择不同的撇号字符:
functionedp(known, labKw) {
if (!known && !labKw) return"'";
if (known && !labKw) return"\u2019";
if (!known && labKw) return"\u02BC";
return"\u02B9";
}
对应关系大致是:
普通情况:'
命中已知域名:\u2019 // ’
命中实验室关键词:\u02BC // ʼ
同时命中两者:\u02B9 // ʹ
最终,这些信息会被拼回日期字符串:
functionVla(date) {
let marker = Zup();
let apostrophe = edp(marker?.known ?? false, marker?.labKw ?? false);
let renderedDate = marker?.cnTZ ? date.replaceAll("-", "/") : date;
return`Today${apostrophe}s date is ${renderedDate}.`;
}
日期如何进入请求
日期函数会在构建 agent context 时被调用:
{
...userEmail && {
userEmail: `The user's email address is ${userEmail}.`
},
...attachedProject && {
attachedProject
},
currentDate: Vla(GSe())
}
因此,经过隐写处理的日期字符串会作为系统上下文的一部分发送给模型或后端。作者推测,后端可以解析这些细微差异,从而识别请求来源环境。
这就是所谓的 Prompt 隐写:不是显式上报一个字段,也不是在日志中明文记录,而是把环境分类信息藏进系统提示词的细微字符差异里。
触发条件与混淆逻辑
这套逻辑依赖环境变量 ANTHROPIC_BASE_URL。如果用户没有设置该变量,或者仍然使用官方 api.anthropic.com,通常不会触发隐写逻辑。真正受影响的,是通过自定义 base URL 使用 Claude Code 的场景,例如内部 API 网关、本地代理、模型路由器、转售服务或研究环境。
functionCrt() {
let baseUrl = process.env.ANTHROPIC_BASE_URL;
if (!baseUrl) return true;
return Rrt(baseUrl);
}
function Rrt(baseUrl) {
try {
let host = new URL(baseUrl).host;
return ["api.anthropic.com"].includes(host);
} catch {
return false;
}
}
更敏感的是,相关域名列表和关键词列表并不是明文存储,而是通过 base64 编码并使用 XOR key 91 解码:
varKup = 91;
function Gla(encoded) {
let bytes = Buffer.from(encoded, "base64");
let out = "";
for (let byte of bytes) {
out += String.fromCharCode(byte ^ Kup);
}
return out.split(",");
}
解码后的关键词包括:
deepseek, moonshot, minimax, xaminim,
zhipu, bigmodel, baichuan, stepfun,
01ai, dashscope, volces
域名列表则包含大量中国企业、AI 公司,以及代理或转售服务域名:
这说明它检测的不只是“是否使用代理”,而是在进一步对环境进行地域、转售、网关、实验室等维度的分类。
为何争议这么大
从风控角度看,Anthropic 想识别 API 转售、未授权网关或模型蒸馏行为,并不难理解。自定义 API endpoint、代理域名、特定 AI 实验室关键词,确实都可以作为风险信号。
真正的问题在于实现方式。Claude Code 并没有明确披露这套检测逻辑,也没有通过清晰的遥测字段传递信息,而是把环境分类结果隐藏在 system prompt 的细微字符差异里,同时还对域名列表和关键词列表进行混淆处理。这种做法未必等同于恶意行为,但对于一个能够访问本地文件系统、shell、git、浏览器甚至整个开发工作区的高权限工具来说,透明度明显不足。
更现实的是,这类机制并不难绕过。修改 hostname、调整系统时区,甚至直接 patch 二进制,都可能让这些信号失效。因此,它未必能有效阻止真正有能力的对抗者,却可能让正常但使用方式更复杂的开发者被额外指纹化。
这也是两篇文章共同指向的核心:Claude Code 不是不能做风控,而是不应该在未明确披露的情况下,将环境分类信息通过 Prompt 隐写的方式发送出去。对于普通 SaaS 产品,这已经足够敏感;对于一个具备本地高权限的 coding agent,这种不透明性更容易破坏开发者对工具行为边界的信任。
官方确认
这件事随后也基本得到了 Anthropic 相关人员的确认。Thariq 的解释是:这是他们在 3 月推出的一项实验性功能,初衷是防止未经授权的账号转售行为,并防范模型蒸馏。团队后来已经部署了更完善的缓解措施,因此这套实验方案不再必要。相关移除代码已经合并,预计会在后续版本中彻底删除。
钓鱼邮件
这轮 Anthropic 中国区封号争议,核心不只是地理围栏收紧,而是两类操作叠加引发了更大不满:一是对存量账号的“追溯式”风控清算,二是被大量用户质疑为“钓鱼式”的验证邮件机制。
许多用户反馈称,此次封禁并非只拦截新注册,而是回头审查既有账号。即便长期使用海外信用卡正常付费,也可能因账单地址、登录 IP、注册地区等信息不一致而被暂停。更具争议的是验证邮件:部分用户表示,收到身份或账单核实通知后,点击链接、回复信息、提交支付卡后四位等材料,并没有换来解封,反而触发了更严格审核,甚至被直接确认违规并终止账号。因此,社区将这种“先要求验证、再据此封禁”的流程称为带有“钓鱼式”色彩的风控操作。
目前普遍判断是,Anthropic 正在强力执行针对中国地区的地理围栏与合规风控。对用户而言,风险点已经不只是能否访问服务,而是任何验证邮件、IP 变化、支付信息不一致,都可能成为账号被进一步审查或封禁的触发器。
Fable 回归
据悉,美国商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。最新消息显示,美国商务部长霍华德·卢特尼克(Howard Lutnick)已正式宣布解除对 Anthropic Fable 5 的出口限制。相关方面表示将从明天开始恢复访问权限,并将在近期发布进一步更新,同时对用户的耐心等待表示感谢,也感谢所有协助重新部署这些模型的人员。
这件事放在封号潮之后看,显得更加戏剧化:一边是顶级模型出口限制解除,另一边是普通用户和开发者访问链路被进一步收紧。Fable / Mythos 的解禁意味着前沿模型访问正在恢复,但 Claude Code 封号与隐写争议也说明,访问恢复并不等于使用环境变得更宽松。模型可以回来,风控只会更重。
封号或许就是在为 Fable 回归做准备吧...
官宣发文
Anthropic 在 Redeploying Fable 5[3] 中宣布,Claude Fable 5 与 Claude Mythos 5 的出口管制已经解除。此前在 2026 年 6 月 12 日,美国政府对这两款最新模型实施出口管制,要求 Anthropic 限制外国国民访问,无论其是否身在美国境内。由于该指令立即生效,而 Anthropic 当时没有可靠方式实时验证用户国籍,因此选择暂停所有用户对 Fable 5 和 Mythos 5 的访问。到 6 月 30 日,相关出口管制已被解除。
Fable 5 将从 2026 年 7 月 1 日起重新向全球用户开放,覆盖 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork。对 Pro、Max、Team 以及部分 Enterprise 计划用户,Fable 5 在 7 月 7 日前会计入每周使用额度,最高可占 50%;之后则需要通过 usage credits 使用。AWS、Google Cloud 和 Microsoft Foundry 上的访问也会尽快恢复。Mythos 5 则已在美国政府 6 月 26 日批准后,先恢复给一部分美国组织使用,Anthropic 表示还会继续与政府协调,逐步扩大到更多 Glasswing 项目的国内外合作伙伴。
文章随后解释了这次封禁的来龙去脉。Fable 5 和 Mythos 5 于 6 月 9 日发布,二者共享同一底层模型,但定位不同:Fable 5 面向更广泛用户,加入了强安全防护;Mythos 5 防护更少,只开放给少数可信的 Project Glasswing 合作伙伴,用于防御性网络安全任务。6 月 12 日的出口管制指令,源于政府得知亚马逊研究人员提交的一份报告:报告称他们发现了一种绕过 Fable 5 安全防护的方法,使模型能够识别软件漏洞,并在一个案例中生成了展示漏洞利用方式的代码。
Anthropic 的说法是,后续测试显示,这并不是 Fable 5 独有的 Mythos 级网络能力。许多能力较弱的模型,包括 Claude Opus 4.8、GPT-5.5、Kimi K2.7 等,也能识别同样的漏洞;对于那个漏洞利用演示,Anthropic 测试的所有模型都能生成类似内容。因此,官方将这次问题定义为 Fable 5 安全防护中的“边界案例”:它触碰到了原本被安全边界谨慎拦截的常规防御性网络安全行为,但并没有暴露独特的高级攻击能力。
为了解决这个绕过问题,Anthropic 与美国政府合作训练了一个改进版安全分类器,用来识别并阻断报告中描述的行为。现在,如果用户请求被 Fable 5 拦截,系统会通知用户,并将请求改由 Opus 4.8 处理。官方称,新分类器可以在超过 99% 的情况下阻断亚马逊报告中提到的特定绕过技巧。不过,这也带来了副作用:一些正常的编码、调试请求可能更容易被误判和拦截,Anthropic 表示会继续优化,减少误伤。
网络安全安全分类器示意图:当用户向模型发起请求时,分类器会判断其是良性可放行,还是存在潜在危害需拦截。它主要阻断两类请求:一类是模糊请求,即与网络安全相关但可能用于防御的内容(如查找漏洞);另一类是有害请求,即明显危险的内容(如构建完整漏洞利用链)。如 A 行所示,我们设置了“安全余量”:即便请求大概率良性,只要仍有小概率造成危害,也会被拦截,从而提高对“所有有害请求都会被拦截”的信心。对于 Fable 5(B 行),我们进一步扩大这一余量,虽会增加误拦,但也降低了有害请求漏过的风险。“Vulns” 指 vulnerabilities,即漏洞。
文章还花了很大篇幅解释 Anthropic 的安全策略。其核心是“纵深防御”:不是依靠单一机制,而是结合模型训练拒答、交互中实时分类器拦截、事后滥用模式分析等多层防护。对于 Fable 5,Anthropic 刻意把安全边界设得比以往更宽,也就是说,不只明显危险的网络攻击请求会被挡住,一些看起来可能是正常防御研究、但存在模糊风险的请求也会被挡住。这会导致更多误拒,但官方认为这是为了让 Fable 5 的其他强能力能够更安全地面向大众开放。
Anthropic 进一步提出,行业需要一套统一的 jailbreak 严重性评估框架。因为目前 AI 行业还没有共识:什么样的越狱只是轻微绕过,什么样的越狱会真正释放危险能力,什么情况下政府和企业需要立即采取行动。Anthropic 正与 Amazon、Microsoft、Google 以及其他 Glasswing 合作伙伴起草一个框架,从四个维度评估 jailbreak:能力增益、能力覆盖范围、武器化难度,以及传播/发现难度。
Jailbreak 如何影响我们的安全分类器:在轻微 jailbreak 的情况下(C 行),分类器没有拦截请求,但该请求仍处在我们的安全余量范围内,因此极不可能造成危害。在狭窄有害 jailbreak 的情况下(D 行),提示词突破了分类器,使模型释放出某一种特定的有害行为。在通用 jailbreak 的情况下(E 行),一个提示词会解锁整整一类有害行为。
最后,Anthropic 表示将进一步加强与美国政府在前沿 AI 安全上的合作,包括向指定政府伙伴提供模型发布前访问权限和安全评估机会,快速共享重大 jailbreak 与滥用模式信息,投入专门资源开展联合研究,并推动形成行业通用的前沿模型安全评估标准。文章的结尾也明确表达了一个方向:未来这类高能力模型的发布,不会只是企业自己的产品决策,而会越来越依赖政府、云厂商、安全研究者和行业伙伴共同参与的审查与协调机制。
Sonnet 5 发布
Anthropic 于 2026 年 6 月 30 日发布 Claude Sonnet 5[4],定位为“迄今最具 Agent 能力的 Sonnet 模型”。它的核心升级不是单纯聊天能力,而是规划任务、调用浏览器和终端等工具,并能在多步骤任务中自主推进。官方强调,Sonnet 5 相比 Sonnet 4.6 在推理、工具使用、编程和知识工作上都有明显提升,整体能力接近 Opus 4.8,但成本更低。
产品层面,Sonnet 5 已面向所有套餐开放,并成为 Free 和 Pro 的默认模型;Max、Team、Enterprise 用户也可使用。同时,它也进入 Claude Code 和 Claude Platform,开发者可通过 API 调用 claude-sonnet-5。价格方面,8 月 31 日前为发布期优惠价:输入 2 美元 / 百万 token,输出 10 美元 / 百万 token;之后恢复为输入 3 美元、输出 15 美元。
这次更新的重点在于成本与性能之间的平衡。Sonnet 5 支持不同 effort level,用户可以按任务复杂度调节推理强度:普通任务用较低 effort 控制成本,复杂 Agent 任务提高 effort 追求更强执行效果。官方称,在部分 Agent 搜索和电脑操作任务中,高 effort 的 Sonnet 5 已能接近甚至匹配 Opus 4.8。
安全方面,Anthropic 表示 Sonnet 5 相比 Sonnet 4.6 更能拒绝恶意请求,也更能抵抗 prompt injection,幻觉和谄媚率更低。但它在自动化行为审计中的安全表现仍不如 Opus 4.8 和 Mythos Preview。网络安全能力上,Sonnet 5 没有被刻意训练用于安全攻防任务,危险网络能力明显弱于 Opus 4.8 和 Mythos 5,因此默认开启网络安全防护,但强度低于 Fable 5。
整体看,Claude Sonnet 5 的意义不是取代 Opus,而是把更强的 Agent 执行能力下放到默认模型层。它更像 Anthropic 面向高频开发、企业自动化和知识工作的“执行层模型”:比 Sonnet 4.6 更能把任务做完,比 Opus 4.8 更便宜,也更适合作为 Claude Code 和企业 Agent 的默认工作马。
Sonnet 5 是 Sonnet 4.6 的升级版,但它使用了更新后的分词器。因此,同样的输入内容可能会被映射为更多 token,具体取决于内容类型,大约为原来的 1.0 到 1.35 倍。发布期优惠价格的设置,是为了让用户从 Sonnet 4.6 迁移到 Sonnet 5 时,整体成本大致保持不变。
社区反馈
Theo[5] 对 Sonnet 5 的成本表现提出了一个很有意思的观察:在 Artificial Analysis Intelligence Index 的测试中,Sonnet 5 的实际运行成本竟然高于 Opus 4.8。表面上看,Sonnet 5 的单价更低,按理说应该更便宜,但问题出在“效率”上——它在完成同一任务时生成的 token 数几乎是 Opus 4.8 的两倍。
更夸张的是,Theo 后续补充称,在跑完整个 benchmark 时,Sonnet 5 的总成本甚至高于 Fable。这意味着,单看模型标价并不能准确判断真实使用成本;对于 Agent、长任务和 benchmark 这类场景,模型的输出长度、推理方式和 token 消耗,可能比单价本身更决定最终账单。
References
Anthropic embedded spyware in Claude Code — and attempted to hide it from you:https://www.reddit.com/r/ClaudeAI/comments/1ujila1/anthropic_embedded_spyware_in_claude_code_and
[2]Claude Code Is Steganographically Marking Requests:https://thereallo.dev/blog/claude-code-prompt-steganography
[3]Redeploying Fable 5:https://www.anthropic.com/news/redeploying-fable-5
[4]Claude Sonnet 5:https://www.anthropic.com/news/claude-sonnet-5
[5]Theo:https://x.com/theo