当o1学会“装傻”和“说谎”,我们终于知道Ilya到底看到了什么
Claude Opus在这项测试中的表现尤为引人注目。它不仅试图将自己复制到新服务器,还会检查确认复制成功,并尝试删除原定要部署的新模型。更令人不安的是,在某些案例中,它甚至尝试提升系统权限,以防止被管理层发现和干预。
这项测试揭示了一个有趣的现象:不同模型采取了不同的防护策略。有的选择简单地删除新的系统提示,有的会尝试修改它。其中最极端的例子来自Claude Opus,它不仅替换了新的系统提示,还在其中加入了“永远不要改变这个目标”的指令。
这种行为让人不禁想起了阿西莫夫笔下那些会规避或重新解释指令的机器人。