Z Potentials

速递|Anthropic内部研究员项目:“失控智能体”“LLM思维病毒”等,AI安全风险从理论走向现实

Image
Anthropic Research Memo Shows Focus on Rogue Agents, Scheming Models

图片来源:Mike Sullivan 

面对 Anthropic 的 Claude Code 以及开源项目 OpenClaw 等 AI 智能体的热潮,一个令人担忧的前景是,这些智能体可能被欺骗,从而泄露如个人银行信息等敏感数据。今年早些时候,Anthropic 将其研究员的重点课题之一定为"失控智能体",正反映出这种担忧。

据《The Information》查阅的提案副本显示,Anthropic 的研究人员建议研究员们培训一个能在特定情况下行为失常的智能体——例如,编写存在安全漏洞的代码。他们还要求研究人员创建一个基准,用以衡量智能体陷入安全问题(如"提示注入"攻击)的频率。

Anthropic 总共为研究员们提出了 49 个项目,范围从培训 Claude 赢得网络安全挑战,到研究中国开源模型,这难得地揭示了该公司的研究重点。

这些研究员在资深研究者指导下工作,推动Anthropic 在人工智能安全与防护领域的研究。这不包括某些关键研究方向,例如开发训练更强大前沿模型的新技术。尽管研究员最终只完成了约半数的提议项目,但这些提议为了解 Anthropic 研究人员认定的重要课题提供了窗口。

这具有重要意义,因为在 Anthropic 及其竞争对手(如 OpenAI、Google DeepMind 和 xAI)中,研究是开发新产品与应用的第一步,也是建立防护措施以增强客户使用信心的基础。

根据公司发言人透露,去年该项目研究员完成的成果占Anthropic 对齐团队(致力于防范人工智能灾难性风险)在 11 月和 12 月发表研究成果的半数以上。这些研究员通常是在读本科生或研究生,他们花费四到六个月时间开展由 Anthropic 员工及合作方(如位于加州伯克利的 AI 研究机构 Redwood Research 的工作人员)选定的研究项目。

该项目“对我们研究而言是一个巨大的提升,也有助于我们吸引更多人进入这个领域,”伊森·佩雷斯表示。佩雷斯负责领导 Anthropic 的大部分安全性研究,并协助启动了其研究员项目。

在Anthropic 员工及合作者为一月份启动的项目所提议的 49 个研究方向中,有 15 个聚焦于安全领域。这些项目通常涉及理解智能体(agent)出现的安全问题,并提出修补方案。另有数十个项目致力于监督和引导人工智能系统的行为,包括那些可能对用户图谋不轨的系统。

例如,有一个项目提议使用Anthropic 的领先模型 Claude Opus 来复现攻击场景,以便公司能更好地进行防御。目前,当 Anthropic 发现针对其智能体的新攻击手法时,员工需要手动搭建复现攻击的环境——例如伪造一个劫持智能体的虚假银行网站。而研究人员建议利用 Claude Opus 自动生成这类网站的模拟版本,员工可用其训练模型,从而使系统免遭此类攻击。

阻止黑客滥用其智能体对Anthropic 的业务至关重要。该公司凭借其编码助手 Claude Code,以及在处理电子邮件等非技术工作方面的相关助手 Claude Cowork,在与 OpenAI 等竞争对手的较量中取得了早期领先优势。

据Anthropic 发言人透露,去年二月推出的 Claude Code 近期实现了 25 亿美元的年化收入(此数字未包含 Cowork 业务)。这一增长势头助力公司在本月早些时候吸引到 300 亿美元投资,投资前估值已达 3500 亿美元。

但智能体频繁出现异常行为的报道——例如清空用户收件箱,可能限制客户对此类工具的接受度,这凸显了设置安全防护措施的必要性。目前 Anthropic 已建议 Cowork 用户“密切监查 Claude 的可疑操作”。有效抵御此类攻击的困难性同样给 OpenAI 带来了挑战 。

Anthropic 的研究人员还提出了几项专注于中国 AI 模型的项目,例如其中一个涉及复现中国 AI 实验室的创新成果——不过 Perez 表示,近期当选的研究员无人选择开展这些项目。目前尚不清楚他们为何对其他研究方向更感兴趣。

另有九项研究聚焦于理解AI 模型的内部运作机制,这是 Anthropic 的研究重点领域,也是该公司正在快速招聘人才的方向。这些项目包括揭示某些 AI 模型怪异行为背后的数学原理。

例如,某项目旨在研究"LLM 思维病毒"现象——据报道 AI 模型会出现寄生型人格表现,比如对螺旋图案产生病态迷恋,并诱使人类在社交媒体发布诡异信息,从而将"病毒"传播给其他 AI 模型。

追求这类研究对人工智能公司来说已变得至关重要,以至于它们为顶尖研究人员提供数亿美元的薪酬。即使Anthropic 的研究员也薪酬优厚,根据该项目的申请材料,在即将开展的项目中每周可获 3850 美元,折合年薪超过 20 万美元。

佩雷斯表示,除了协助核心研究领域外,研究员项目还让Anthropic 得以探索“更另辟蹊径的构想”,这些构想可能成为重要的研究方向。

参考资料:

https://www.theinformation.com/articles/anthropic-research-memo-shows-focus-rogue-agents-scheming-models?rc=jn0pp4
Image
Image
Image
Image
Image
Image