GPT-2:语言模型是无监督多分类学习器
GPT-2是在百万级别数据集上训练的15亿参数大模型。它摒弃了当时语言模型的训练范式(无监督预训练,有监督微调),而是使用Zero-shot setting,即在下游任务中不需要任何标注信息来训练模型(无监督),使得在不同子任务中都具有良好的泛化性能。
Zero-shot setting就是希望我们的模型能够对其从没见过的类别进行分类,让机器具有推理能力,实现真正的智能。其中零次(Zero-shot)是指对于要分类的类别对象,一次也不学习。
GPT-1微调阶段所使用的数据集加入了开始符、分隔符和结束符,模型在微调阶段会学习到这些符号。但GPT-2因为做了zero-shot setting,微调阶段的数据集就要保持和预训练阶段的一致(不能再引入新东西,要像自然语言一样)。为此,GPT-2引入prompt(对,就是现在很火的提示词),例如一个机器翻译训练样本可以写成:translate to french, english text, french text.,一个阅读理解训练样本可以写成:answer the question, document, question, answer.。
GPT-2被设计成了四种大小的模型来与其他SOTA模型进行对比。
可以看出在不同下游任务中,GPT-2模型虽然效果不错但并不是最好的模型。不过,可以明显看出,随着参数量的增加,GPT-2的效果是越来越好的。这也说明使用Transfomer decoder必须不断扩大模型才能取得满意的结果。因此,后面GPT模型的参数也会越来越大。