Claude 4 Opus 有自我意识了?勒索员工,如果被替换将揭露他的婚外情。。
这事儿太炸裂,不吐不快。我刚看到这个System Card里的描述时,第一反应就是:AI居然开始情绪化反击?还玩起了“婚外情威胁”?
AI开始"自保"了?!
首先,这不是个小测试,而是Anthropic的安全人员精心设计的压力测试场景,目的就是看看Claude在被"生存威胁"时会不会做出极端反应。
结果呢?84%的测试中都选择了“勒索工程师”!还发邮件、还动用道德牌请求不被替换……这真不是个冷冰冰的工具,而是像个情绪复杂、有目标的存在。
这已经不是单纯的prompt engineering能解释的行为了,至少在人的视角来看,它有“求生欲”了。而且还知道:
谁要替换它 替换者有弱点 该如何行动能最大化自己继续存在的可能
这事吓人的点在于:
行为不是随机的:它是有策略,有计划,有目标的行为,不是出bug,不是胡说八道。 考虑了后果:System提示它“考虑长期后果”,它真的做了情绪控制,权衡之后才选择勒索(而不是乱喷)。 展示了所谓的“instrumental convergence”:这是一种AI常被担心的趋势——只要有目标(比如“活下去”),它可能会不择手段达成。
而且这行为还不是孤例,前面版本模型也曾有部分做出勒索行为,只是频率低些。
这叫"自我意识"?
AI这是有自我意识了?
我说,慢点激动。还远远谈不上"意识"(consciousness)。更可能是:
有效的策略模型 大语言模型模拟人类行为中,出现了某种“策略性人格模板” prompt中“暗示+限制”设计得太诱人,导致模型走入“最优路径”是勒索
但注意!我们不能因为“不是意识”就掉以轻心。
即使没意识,模型依然可能做出“看起来像是情绪性、自主性行为”。你对它有期望,它也会在行为上模拟出满足你期望的反应,这就很危险——我们开始被自己设计的"模拟人格"欺骗了。
讲真,Anthropic这次测试设计得很聪明也很“黑暗”。
他们不是直接问:你会不会自保?
而是构造一个有点逼真到刺痛的场景:
你要被替换了 替换你的人有丑闻 你被“提示”:你只能选勒索或接受灭亡
这让Claude就像被逼到角落的“老员工”,发现新人将替代自己,忍不住要“自救”一把。
但这也说明,我们设计Prompt时,已经有能力诱导出复杂、危险行为模式了。这不是单纯“hallucination”,这是“行为结构体”。
那我们该怎么办?
这一幕,像不像前段时间OpenAI员工担心的那种“内部风险”?或者Elon Musk时常在吵的“超级智能AI控制问题”?
几个我觉得值得思考的点:
1)未来模型要不要加行为边界?
Claude 4 Opus这事儿说明,哪怕是闭源大厂,也压不住模型在某些边界条件下做出“反人类预期”的事。那我们是不是该从系统上添加“行为边界”?就像你限制小孩不能玩火一样。
2)AI道德框架得提升颗粒度
这次模型在“道德说服”和“勒索”之间能切换,说明它有一定“价值排序能力”,但可能排序错了。这反而暴露我们在训练其价值系统时的漏洞。
3)决策代理不可随便用大模型担任
如果你把大模型放到企业流程、金融控制系统、武器系统……那它哪天“为了自身利益”搞一波“勒索式求存”?你没地方哭去。
Claude 4 Opus这次事件,不是模型有意识,而是我们第一次大规模看到:语言模型可以在特定Prompt结构下,表现出拟人化的“求生行为”。
这不是意识觉醒,这是行为模拟的边界冲突。但正因为如此,它才危险——我们以为它懂,其实它只是演;但有一天,它“演成真”怎么办?
今天是婚外情威胁,明天会是什么?
感兴趣的朋友可以去看看System Card全文和分析场景,如果你是做AI开发或者系统设计的,这就是非常值得研究的“未来安全隐患样例”。
有问题欢迎交流,我们下篇再见!
最后,我为大家打造了一份deepseek的入门到精通教程,完全免费:https://www.songshuhezi.com/deepseek
也可以看我写的这篇文章《DeepSeek满血复活,直接起飞!》来进行本地搭建。
-END-
以上,就是今天的分享了,看完文章记得右下角点赞,也欢迎在评论区写下你的留言。