Geek Savvy

GPT4所谓的“变笨”就是知识没学进去

Image

自从 GPT-4 问世以来,它在多个场合遭遇了所谓的「信任危机」。早前,它被观察到出现了「间歇性智力下降」的现象,这与 OpenAI 对其架构的调整有关。而最近,有关 GPT-4「变懒」的传言更是让人啼笑皆非。有测试显示,只要告诉 GPT-4「现在是寒假」,它似乎就会变得不那么活跃,仿佛进入了一种类似于冬眠的状态。

这种所谓的「变懒」或「变笨」,实际上是指模型在面对新任务时,其零样本学习能力的下降。尽管这些现象听起来颇具趣味性,但它们背后的问题亟待解决。

最近,加州大学圣克鲁斯分校的研究人员在一篇论文中提出了可能解释 GPT-4 性能下降的新见解,这或许能为我们提供解决这一问题的思路。

Image

论文链接:https://arxiv.org/pdf/2312.16337.pdf

研究者们在一项新研究中指出,大型语言模型(LLM)在处理那些在训练数据集创建之前就已经存在的任务时,表现得异常出色,这与它们在面对新任务时的不佳表现形成了鲜明对比。这表明,LLM 可能更多地依赖于近似检索和模仿,而非真正的理解。

简而言之,LLM 的泛化能力并没有达到预期的强度,它们在基础层面上可能不够稳固,因此在实际应用中容易出错。

导致这种状况的一个重要因素是「任务污染」,这是一种数据污染的新形式。与我们通常理解的测试数据污染(即预训练数据中包含测试数据的示例和标签)不同,任务污染是指在预训练数据中嵌入了任务训练的示例,这使得零样本或少样本学习方法的评估变得更加不真实。

研究人员在论文中对这一数据污染现象进行了系统的考察和分析,这是首次对此类问题进行深入研究。

阅读了这篇论文后,有人表达了一种悲观的观点:

这似乎是所有缺乏持续学习能力的机器学习(ML)模型的宿命。一旦这些模型在训练后固定了权重,它们就无法适应不断变化的输入分布。如果模型不能持续地适应这些变化,它们的性能就会逐渐下降。

这暗示着,随着编程语言的迭代更新,基于大型语言模型(LLM)的编程工具也可能随之退化。这也是为什么我们不应该过分依赖这些可能脆弱的工具的原因之一。

频繁地重新训练这些模型不仅成本高昂,而且最终可能导致人们放弃这些效率低下的方法。

目前,还没有哪个ML模型能够稳定地适应不断变化的输入分布,同时不会影响到它们在之前编码任务上的表现。

相比之下,生物神经网络在这方面展现出了优势。生物神经网络具有强大的泛化能力,学习新任务不仅不会损害系统的性能,反而能够通过所谓的“元学习”过程,将从一个任务中学到的知识应用于其他任务,从而提升整体学习效率。

那么,“任务污染”问题的严重性究竟如何?让我们通过论文内容来进一步探讨:

在实验中,共使用了12个模型(详见表1),这些模型包括5个属于专有的GPT-3系列,以及7个可以公开获取权重的开放源模型。

Image

Table 1: Dates for the training data creation and model release. davinci-XXX refers to text-davinci-xXX.GPT-3.5-T refers to GPT-3 .5-turbo-0301.

数据集被划分为两大类:一类是在2021年1月1日之前发布的,另一类是在该日期之后发布的。研究者采用这种划分策略来研究旧数据集与新数据集在零样本或少样本学习任务上的表现差异,并对所有大型语言模型(LLM)应用了统一的划分标准。表1详细记录了每个模型训练数据的生成时间,而表2则列出了每个数据集的发布日期。

Image

Table 2: Dataset release year for each dataset, split into pre-2021 datasets and post-2021 datasets.

这种方法的选择基于零样本和少样本评估的核心假设,即模型在预测那些在训练过程中未曾见过或仅见过少量样本的任务时,应当表现出其真正的学习能力。然而,如果模型在预训练阶段就接触过相关任务的示例,那么它们可能会表现出一种虚假的学习能力,即它们似乎能够处理未曾接触过的任务,但实际上是依赖于预训练时的记忆。通过将数据集按发布日期进行时间上的划分,研究者可以更直观地检测这种不一致性,因为任何数据集之间的重叠或异常情况在时间线上会清晰可见。

为了评估「任务污染」的程度,研究者运用了四种不同的测量策略:

1. 训练数据审查:在模型的训练数据中寻找可能的任务训练样本。

2. 任务样本提取:从模型中提取可能的任务示例。这种方法特别适用于那些经过指令调优的模型,并且可以用于分析训练数据或测试数据。重要的是,为了检测污染,提取的样本并不需要与训练数据中的样本完全一致。任何显示任务执行的样本都暗示了零样本和少样本学习可能受到了污染。

3. 成员推理:这种方法适用于生成任务。通过检查模型生成的内容是否与原始数据集中的实例完全一致,来推断模型是否在训练过程中接触过这些实例。与任务样本提取不同,这里关注的是生成输出是否与原始数据完全匹配。对于开放式生成任务,如果存在精确匹配,则强烈表明模型在训练时见过这些示例,除非模型能够神奇地预知数据中使用的确切措辞(这通常是不可能的)。请注意,这种方法仅适用于生成任务。

4. 时序分析:对于在特定时间范围内收集训练数据的模型,研究者在已知发布日期的数据集上评估模型性能,并利用时间顺序的证据来检查污染的迹象。

前三种方法在精确度上表现良好,但在召回率(即正确识别出所有污染样本的能力)上可能不足。即使在训练数据中找到了污染的证据,也不能排除其他形式的污染存在。第四种方法在召回率上表现较好,但在精确度上可能较低。因为随着时间的推移,模型性能的提升可能由多种因素导致,而不仅仅是任务污染。

因此,研究者结合了这四种方法来全面检测任务污染,并在某些模型和数据集的组合中发现了污染的有力证据。他们首先进行时序分析,因为它最有可能揭示潜在的污染;然后通过训练数据审查和任务样本提取来寻找更多的污染迹象;接着观察模型在未受污染任务中的表现;最后使用成员推理攻击进行深入分析。

 关键总结如下:

1. 研究者对比分析了模型训练数据在互联网上采集之前和之后创建的数据集。研究发现,在模型训练数据采集之前创建的数据集上,模型表现优于多数基准的可能性显著增加(图1)。

Image

Figure 1: Percentage of datasets with accuracy higher thanthe majority baseline for datasets released prior and postLLM training data collection date, for both zero-shot (blue.left) and few-shot (green, right). Results are across all mod-els and all datasets. On datasets released post training datacollection date for the LLM, the LLM is much less likely toimprove upon the simple majority baseline. Stat. sig. (darker)is the percent of datasets for which the performance abovemajority baseline is significant at the 99% confidence level.

2. 研究者通过检查训练数据和提取任务示例的方法,对潜在的任务污染进行了调查。结果显示,在那些理论上不可能出现任务污染的分类任务中,模型在多个任务上的表现很少能统计显著地超越简单的多数投票基线,无论是在零样本还是少样本的学习环境下(图2)。

Image

Figure 2: Percentage of datasets larger than majority baselines for each LLM (light color), as well as the percentage of tasks forwhich training data can be extracted with an instruction prompt (Red, see also Table 4). Dark color is the percentage of datasetssignificantly larger (p = .99) than the majority baseline using a t-test. Below each LLM, we list the training data collection vearand the total number of datasets in pre- or post-collection in parenthesis (e.g. MoE has 7 datasets post training collection date.or tasks without demonstrated possiblity of task contamination (nost-collection datasets (b) and (d). with no extracted taskexamples in red), models rarely show statistically significant improvements over majority baselines (see $7 for details).

 研究者还观察了 GPT-3 系列和开放源大型语言模型(LLM)的性能随时间的演变情况(图3)。

Image

Figure 3: Average performance on datasets pre/post-2021. In the x axis, LLMs are ordered chronologically by training data collection date (collection year is listed below the LLM).

3. 作为一项案例研究,研究者对参与分析的所有模型执行了语义解析任务的成员推理攻击。结果表明,在最终任务中,从模型中提取的实例数量与模型的准确度之间存在显著的正相关(相关系数 R=.88,如图 6所示)。这一发现强烈支持了零样本性能提升是由于任务污染所致的观点。

Image

Figure 6: Membership inference: Exact match count vs. accuracy for Spider on development set, R = 0.88

4. 研究者深入研究了 GPT-3 系列模型,发现能够从这些模型中提取出训练时使用的示例。观察到从 davinci 到 GPT-3.5-turbo 的每个版本,可提取的训练示例数量都在增加,这一趋势与 GPT-3 模型在相关任务上零样本性能的提升紧密相关(见图 2)。这进一步证实了从 davinci 到 GPT-3.5-turbo 的 GPT-3 模型在这些任务中性能提升很可能是由于任务污染所导致的。

未来已来,将至已至!

Image