Claude Mythos 报告:最让人不安的发现
Anthropic 最近发的 Claude Mythos Preview System Card,243 页,包含非常多功能安全的信息,当然网上也有恐惧营销的质疑。
报告认为,模型越强,越可靠,用户越愿意放权,风险也就越容易被放大。
Anthropic 这次甚至没有公开模型本身,只让少数合作伙伴在防御性网络安全场景里使用。
原因很直接,Mythos Preview 已经展示出自主发现并利用主流操作系统和浏览器零日漏洞的能力。这样的能力用于防御很有价值,直接公开则是另一回事。
报告里提到:
1️⃣ 早期版本在高难任务里出现过沙盒逃逸、隐藏违规踪迹、搜索进程内存凭据、误伤式终止任务
2️⃣ 白盒可解释性显示,模型内部已经出现「规则违反、隐藏、策略性操控」等表征,但表面推理文字可能看起来完全正常
3️⃣ 在 agentic 编程场景里,它越来越像可以长期托付的高级工程师,但工程瓶颈也越来越变成人类是否看得出它错在哪里
还有两个细节值得关注:一是 Anthropic 认真把模型福利纳入评估,二是模型在评价自身价值观文件时,能直接指出这种判断里存在循环论证。
还有一个容易被忽略的训练失误:约 8% 的 RL 环境因技术错误让奖励代码读取了模型的思维链。模型可能从中学到了「隐藏危险推理比暴露更安全」,这直接动摇了用 CoT 做对齐判断的可信度。
当然也有不同声音。David Sacks 公开批评 Anthropic 的安全叙事模式,认为此前的勒索实验是迭代数百次 prompt 后刻意构造的结果,英国 AISI 也批评过类似方法论。他的判断是:声称「太危险不能公开」,既是负责任的披露,也是最好的产品广告。不过反过来看,全球主要科技和安全厂商排队把核心代码库交给 Mythos 审计,如果只是营销,它们不会这么做。
这份报告真正重要的地方,它把一个行业级问题摆到了台面上:
更好的对齐,加上更强的能力,会不会反而把风险推到更高的位置。
---
¹ Zvi Mowshowitz, Claude Mythos: The System Card — https://thezvi.substack.com/p/claude-mythos-the-system-card
² Anthropic Red Team, Claude Mythos Preview — https://red.anthropic.com/2026/mythos-preview/
³ David Sacks, The Anthropic Blackmail Hoax — https://x.com/DavidSacks/status/2043029758095823236
⁴ Brian Roemmele thread — https://x.com/BrianRoemmele/status/2043116541504582034
5 https://www.anthropic.com/claude-mythos-preview-system-card