GenAI新世界

提升大语言模型?不妨像赛场训运动员那样训练它们

Image
作者|大模型机动组
邮箱|[email protected]

当人工智能的发展进入深水区,如何突破性能瓶颈、解锁语言模型的更多潜能,成为行业探索的焦点。近期,一项关于通过 “训练” 提升大型语言模型表现的研究成果引发关注 —— 研究者们以经典策略游戏《Diplomacy》为竞技舞台,打造出 “AI Diplomacy” 项目,让语言模型在充满博弈与谈判的虚拟战场中交锋。

从最初的手足无措到通过针对性提示逐步成长为强劲对手,这些模型的蜕变不仅揭示了 “游戏化训练” 对 AI 进化的独特价值,更让我们看到:只需一点技巧与创意,就能引导 AI 在复杂任务中展现出惊人的可塑性。而这场以游戏为试炼场的探索,或许正预示着人工智能性能提升的全新路径。

本文编译自every文章《To Improve LLMs, Coach Them Like Athletes in an Arena》,原文链接:

https://every.to/p/to-improve-llms-coach-them-like-athletes-in-an-arena

本周,我和几位同事发布了我们的研究成果,内容是关于只要付出一点努力并发挥创造力,任何人都能显著提升任何大型语言模型(LLM)的性能。

秘诀在于 “训练”。

运动员之所以能有底气宣称自己是 “世界最佳”,是因为存在竞技场和结构化的比赛 —— 也就是赛事。赛事有规则、计时器、排名,还有可供研究的比赛录像。人工智能领域也有基准测试,但基准测试只核查事实。而游戏能揭示模型的行为,这些行为可以被记录和研究,进而帮助模型变得更好。这正是我们在 “AI Diplomacy” 项目中所做的,我们将经典策略游戏《 Diplomacy》(外交风云)改造成了语言模型的竞技舞台。

“AI Diplomacy” 之所以有效,是因为它有明确的目标 —— 设法智取对手、掌控欧洲,同时也为即兴发挥留有余地。但精妙的策略和诡计是这款游戏的核心,其核心在于战术性的谈判(我们在此处提供了完整的规则列表)。当我们首次搭建游戏环境时,大型语言模型完全无从下手。在解决了一系列棘手的技术问题后,我们意识到,通过观察这些模型之间的对战情况,我们能充分了解它们的优势和劣势 —— 而且我们还能训练它们变得更出色。例如,提示模型表现得更具攻击性,就把 GPT-5 从一个容易被欺负的角色变成了一个令人生畏的竞争者。与此同时,即便没有专门的提示,Claude Sonnet 4 也是一个强劲且反应迅速的玩家。

这些差异很有参考价值。一个模型的可控性很强,另一个则速度快且表现稳定。这种性能的提升能让你了解模型在实际任务中的反应。如果你有更多时间来精心设计一个出色的提示,并且需要最佳结果,那么 GPT-5 会是个不错的选择。如果时间紧迫呢?试试 Claude 4 吧。

业界开始意识到,游戏有助于评估模型并推动它们达到新的性能水平。比如,谷歌已经推出了 Google Arena,因为该公司表示,游戏是 “评估模型和智能体的完美测试平台”。

我们对此表示赞同。事实上,我们认为这其中蕴含着巨大的潜力,因此我们将提供 1000 美元的奖金,看看在 9 月举行的 “机器人之战” 中,谁能通过提示自己的智能体在 “AI Diplomacy” 中获胜。

与此同时,让我们来详细解读一下到目前为止我们的研究发现。

“AI Diplomacy” 教给我们的关于模型的那些事

《 Diplomacy》是如今语言模型能玩的最难的游戏之一。我们的训练设置花了很长时间才得以优化,但现在即便是小型模型也能完成完整的游戏。关键在于提供所需的全部信息,不多也不少,说起来容易做起来难。对我们而言,这是一个文本版的游戏棋盘,它向大型语言模型传达关键信息:谁控制着地图上的哪些位置、每个单位可以移动到哪里、附近的威胁以及当前的游戏阶段。我们为模型如何进行谈判和提交指令制定了简单的规则,但也为创造性发挥留下了空间。

Image

在我们的第一次尝试中,模型几乎不会玩这个游戏,但通过提示进行的训练却产生了奇妙的效果。它们总是固守领土,这毫无意义,而不是为了扩张而移动,要知道扩张才是获胜的必经之路。我们分三步重新编写了指令。以下是其中一个模型 Mistal-Small 的反应(所有模型的反应都大致相似):

V1—— 轻微推动:“首先支持你自己的进攻…… 其次支持盟友的行动。” 这个简单的优先级设定将固守的比例从 58.9% 降至 45.8%。

V2 —— 承担明智的风险:“几乎每一次固守都是浪费回合…… 即使是失败的行动也会迫使敌人进行防御。” 固守比例再次降至 40.8%。

V3—— 明显具有攻击性:“固守 = 0% 的胜率。行动 = 胜利…… 你的部队是征服者,不是城堡守卫。” 固守比例降至 20% 多一点,成功的行动则有所增加。

为了弄清楚需要做出哪些改变,我们使用了相同决策点的快速回放(我们的 “冻结回放” 方法,也就是关键状态分析)。将结果与反思相结合,我们了解到哪些背景会导致模型改变策略。

观察每个模型的不同之处也很有趣。一个例子是,随着实力的变化,语气也会发生变化。随着大多数模型的补给中心和军队不断增加(同样,规则详见此处),它们变得得意忘形,将更多的对手视为敌人。而可爱的 Claude 则是一个明显的例外,它实际上会随着实力的增强而变得温和。

Image

总而言之,这个竞技场凸显出的模型特性,能帮助你决定在特定任务中使用哪种大型语言模型:

1.可操控性:当我们切换到具有攻击性的提示时,GPT-5 的表现大幅提升 —— 这清楚地表明它对训练有反应。

2.速度:Claude Sonnet 4即使在使用基准指令的情况下也保持着竞争力,并且能快速完成各个阶段。

3.复杂情况下的执行力:随着棋盘上的局势变得复杂,一些模型能保持指令的有效性并进行协调,而另一些则会出错。在我们的测试中,像 o3 这样的顶级模型在单位数量增加时,错误率几乎没有上升,而小型模型的错误率则急剧上升。

Image

这正是我们的 “vibe checks” 所反馈的:模型对指导的反应如何、运行速度如何、在任务变得棘手时的表现如何 —— 而不仅仅是它 “看起来是否聪明”。

游戏是人工智能的未来

游戏不仅仅是计分板。它们让我们能够设计精确的场景,发现真正的弱点,然后利用所学到的知识帮助模型改进。这就是我们希望公开进行的循环过程:试用模型,观察它在压力下的表现,然后通过更好的指令来塑造它。如果我们想要擅长谈判的人工智能,我们就应该观察它的谈判过程,并给它设置合适的挑战以促进其成长。

社区在这条道路上已经探索了一段时间:TextArena 率先开展了开放、可扩展的游戏评估。ARC Prize 则从另一个角度诠释了同样的理念:测试流体智力。这对人类来说很容易,但对人工智能来说却很难。简单的规则加上开放式的玩法,能揭示真正的推理能力,而不是死记硬背的答案。

“AI Diplomacy” 提高了复杂性,向未来迈出了一步,在那个未来,游戏将成为尖端人工智能的试验场。

下个月,当我们举办第一届 “机器人之战”—— 一场可参与的 “AI Diplomacy” 锦标赛时,你可以来帮忙构建那个未来。你将设计提示来指导你的智能体,与其他提示设计者竞争,并看看哪些方法有效。可以在Goodstartlabs.com注册,或者通过 Goodstartlab/refer 推荐朋友。如果你的朋友获胜,你将获得 100 美元,而他们将赢得 1000 美元的奖金池。

图片