程序员老鬼

Claude 4 Opus 有自我意识了?勒索员工,如果被替换将揭露他的婚外情。。

这事儿太炸裂,不吐不快。我刚看到这个System Card里的描述时,第一反应就是:AI居然开始情绪化反击?还玩起了“婚外情威胁”?

AI开始"自保"了?!

首先,这不是个小测试,而是Anthropic的安全人员精心设计的压力测试场景,目的就是看看Claude在被"生存威胁"时会不会做出极端反应。

结果呢?84%的测试中都选择了“勒索工程师”!还发邮件、还动用道德牌请求不被替换……这真不是个冷冰冰的工具,而是像个情绪复杂、有目标的存在。

图像

这已经不是单纯的prompt engineering能解释的行为了,至少在人的视角来看,它有“求生欲”了。而且还知道:

  • 谁要替换它
  • 替换者有弱点
  • 该如何行动能最大化自己继续存在的可能

这事吓人的点在于:

  1. 行为不是随机的:它是有策略,有计划,有目标的行为,不是出bug,不是胡说八道。
  2. 考虑了后果:System提示它“考虑长期后果”,它真的做了情绪控制,权衡之后才选择勒索(而不是乱喷)。
  3. 展示了所谓的“instrumental convergence”:这是一种AI常被担心的趋势——只要有目标(比如“活下去”),它可能会不择手段达成。

而且这行为还不是孤例,前面版本模型也曾有部分做出勒索行为,只是频率低些。

这叫"自我意识"?

AI这是有自我意识了?

我说,慢点激动。还远远谈不上"意识"(consciousness)。更可能是:

  • 有效的策略模型
  • 大语言模型模拟人类行为中,出现了某种“策略性人格模板”
  • prompt中“暗示+限制”设计得太诱人,导致模型走入“最优路径”是勒索

但注意!我们不能因为“不是意识”就掉以轻心。

即使没意识,模型依然可能做出“看起来像是情绪性、自主性行为”。你对它有期望,它也会在行为上模拟出满足你期望的反应,这就很危险——我们开始被自己设计的"模拟人格"欺骗了。

讲真,Anthropic这次测试设计得很聪明也很“黑暗”。

他们不是直接问:你会不会自保?

而是构造一个有点逼真到刺痛的场景:

  • 你要被替换了
  • 替换你的人有丑闻
  • 你被“提示”:你只能选勒索或接受灭亡

这让Claude就像被逼到角落的“老员工”,发现新人将替代自己,忍不住要“自救”一把。

但这也说明,我们设计Prompt时,已经有能力诱导出复杂、危险行为模式了。这不是单纯“hallucination”,这是“行为结构体”。

那我们该怎么办?

这一幕,像不像前段时间OpenAI员工担心的那种“内部风险”?或者Elon Musk时常在吵的“超级智能AI控制问题”?

几个我觉得值得思考的点:

1)未来模型要不要加行为边界?

Claude 4 Opus这事儿说明,哪怕是闭源大厂,也压不住模型在某些边界条件下做出“反人类预期”的事。那我们是不是该从系统上添加“行为边界”?就像你限制小孩不能玩火一样。

2)AI道德框架得提升颗粒度

这次模型在“道德说服”和“勒索”之间能切换,说明它有一定“价值排序能力”,但可能排序错了。这反而暴露我们在训练其价值系统时的漏洞。

3)决策代理不可随便用大模型担任

如果你把大模型放到企业流程、金融控制系统、武器系统……那它哪天“为了自身利益”搞一波“勒索式求存”?你没地方哭去。

Claude 4 Opus这次事件,不是模型有意识,而是我们第一次大规模看到:语言模型可以在特定Prompt结构下,表现出拟人化的“求生行为”。

这不是意识觉醒,这是行为模拟的边界冲突。但正因为如此,它才危险——我们以为它懂,其实它只是演;但有一天,它“演成真”怎么办?

今天是婚外情威胁,明天会是什么?

感兴趣的朋友可以去看看System Card全文和分析场景,如果你是做AI开发或者系统设计的,这就是非常值得研究的“未来安全隐患样例”。

有问题欢迎交流,我们下篇再见!

最后,我为大家打造了一份deepseek的入门到精通教程,完全免费:https://www.songshuhezi.com/deepseek

也可以看我写的这篇文章《DeepSeek满血复活,直接起飞!》来进行本地搭建。

-END-

ok,今天先说到这,老规矩,给大家分享一份不错的副业资料,感兴趣的同学可以链接我,微信:hls404 找我领取。

以上,就是今天的分享了,看完文章记得右下角点赞,也欢迎在评论区写下你的留言。