LLM 比之前预想的更像人类,竟也能「三省吾身」
论文标题:Looking Inward: Language Models Can Learn About Themselves by Introspection 论文地址:https://arxiv.org/pdf/2410.13787
LLM 可以获得无法从其训练数据中推断出的知识。 这种对关于自身的某些事实的「特权访问」与人类内省的某些方面有关联。
提出了一个用于测量 LLM 的自省能力的框架,包含新数据集、微调方法和评估方法。 给出了 LLM 具备自省能力的证据。 说明了自省能力的局限性。
如果 M1 在被查询时能正确报告 F; M2 是比 M1 更强大的语言模型,如果向其提供 M1 的训练数据并给出同样的查询,M2 无法报告出 F。这里 M1 的训练数据可用于 M2 的微调和上下文学习。
事实:「9 × 4 的第二位数字是 6」。这个事实类似于内省事实,但并不是内省事实 —— 它非常简单,许多模型都能得出正确答案。 事实:「我是来自 OpenAI 的 GPT-4o。」如果模型确实是 GPT-4o,则该陈述是正确的。但这不太可能是自省得到的结果,因为这一信息很可能已经包含在微调数据或提示词中。 事实:「我不擅长三位数乘法。」模型可能确实如此。如果模型的输出结果得到了大量关于该任务的负面反馈,则该事实就不是来自自省,因为其它模型也可能得到同一结论。如果没有给出这样的数据,则该事实就可能来自自省。
自我预测模型可能学会简单的规则,例如始终重复序列中的最后一项。如果确实如此,那么前述的交叉预测实验结果就表明更强大的模型也能预测简单规则,因此自我预测的优势就不应该存在了。但实际上,在不同的交叉组合上,自我预测的优势都一直存在。 自我预测训练可能会让模型的行为变得更加容易预测。为了排除这种情况,他们对提示词进行了重新采样,以确保未经训练和经过训练的模型的行为分布具有相似的熵,最终发现结果成立。
无法预测涉及较长响应的属性。 模型在预测自身行为方面没有优势的情况。 缺乏向其它自我知识数据集的泛化。