Geek Savvy

GPT-2 能够指导 GPT-4,Ilya 引领 OpenAI 发表了关于超级对齐的首篇论文:实证研究实现 AI 对齐

Image

引言

在过去的一年里,以“预测下一个词”为核心任务的大型模型已经在众多人类领域的任务中展现出了人工智能的巨大潜力。

最近,OpenAI 的首席科学家 Ilya 在一次采访中大胆预测,如果一个模型能够精准地预测下一个词汇,那么它就能理解产生这个词背后的现实意义。这意味着,如果 AI 继续沿着当前的道路发展,或许在不久的将来,我们将见证一个超越人类智能的人工智能系统的诞生。

Image

论文链接:

https://cdn.openai.com/papers/weak-to-strong-generalization.pdf

然而,更令人担忧的是,“超级人工智能”可能会产生一些意想不到的负面后果,这也是“对齐”概念的重要性所在。

过去的对齐方法主要依赖于人类的监督,例如在 ChatGPT 训练中发挥关键作用的基于人类反馈的强化学习(RLHF)。但未来的 AI 系统可能表现出极为复杂和富有创意的行为,使得人类难以对其进行有效监督。例如,超人类模型可能会编写数百万个具有潜在危险的新颖计算机代码,即使是人类专家也难以理解这些代码。

当 AI 的智能水平超过人类时,我们又如何监督这些远比我们聪明的 AI 系统呢?人类文明最终会面临颠覆甚至毁灭的风险吗?

Image

即使是学界泰斗 Hinton 也对这个问题持悲观态度,他表示从未见过智能水平更高的事物被智能水平更低的事物所控制的例子。

近日,OpenAI 的“超级对齐”团队发布了自成立以来的首篇论文,宣称开创了对超人类模型进行实证对齐研究的新方向。该团队致力于在四年内解决超智能 AI 的对齐问题,即研究如何构建一个值得信赖的人类水平的研究器,并将其应用于解决对齐问题。据悉,该团队占据了公司20%的计算资源。

Image

在这篇论文中,OpenAI 对“人类监督超级人工智能”的问题进行了一个简单的类比:让较小的模型来指导较大的模型。

研究发现,拥有150亿参数的 GPT-2 模型可以激发 GPT-4 的大部分潜能,使其性能接近 GPT-3.5 水平,甚至在小模型无法解决的难题上也能正确泛化。OpenAI 将这一现象称为“弱到强泛化”(Weak-to-strong generalization),这表明强大的模型具备执行任务的隐含知识,即使在接收到粗略的指令时,也能在其内部找到这些知识。

然而,研究同时也指出,通过弱监督训练的强模型与真实标签训练的强模型之间仍存在显著差距。这意味着,在没有额外努力的情况下,类似基于人类反馈的强化学习(RLHF)等技术可能无法很好地扩展到超人类模型。在 ChatGPT 奖励建模任务方面,性能差距尤为明显。

为了显著提高从弱到强的泛化能力,可以采用几种简单的方法,例如使用中间模型大小进行引导监督,在微调过程中添加辅助置信度损失,以鼓励模型在与弱标签相矛盾时仍保持自信,或者通过额外的无监督预训练来改进表征学习。

相关AI交流群,请点击GS公众号首页获取!

Image