ChaosstuffAI

怎样使用LLM代替人类评估?

LMSYS 发表过一篇名为“Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena”的论文,研究表明像 GPT-4 这样的强大 LLM 评判者可以很好地匹配受控和众包的人类偏好,实现超过 80% 的一致性,与人类之间的一致性水平相同。因此,LLM 作为评判者是一种可扩展且可解释的方法来近似人类偏好,同时可以达到远低于人类评判者的成本。

那么如何使用 LLM 来代替人类评估呢

将 LLM 作为裁判可以分为三种情况:

  • 对比评估:LLM 评委在两个答案中选择一个更好的或宣布平局。Image
  • 单一答案评分:LLM 评委直接为单个答案打分。Image
  • 参考引导评分:提供参考解决方案来进行打分。Image

使用这三种方式分别在 MT-bench 和 Chatbot Arena 基准上评估 LLM 评委的有效性和一致性。

“

MT-bench 包含 80 个高质量的多轮问题,涵盖写作、角色扮演、提取、推理、数学、编码、STEM 和人文科学等类别。Chatbot Arena 是一个众包平台,用户可以同时与两个匿名模型互动并投票选择更喜欢的响应。

结果表明:

  • 在 MT-bench 上,GPT-4 评委与人类专家之间的一致性超过 85%,甚至高于人类之间的一致性(81%)。Image
  • 在 Chatbot Arena 上,GPT-4 评委的非平局一致性比率与其他LLM评委相似,但非平局投票数更多,表明 GPT-4 评委更肯定且受位置偏见影响较小。Image

但 LLM 作为评委也有局限性:

  1. 位置偏差:LLM 倾向于在某些位置上表现得比其他位置更好。这种偏见并不局限于模型输入的上下文,在人类决策和其他机器学习领域也有观察到。Image
  2. 冗长偏差:LLM 更喜欢更长的回答(包括含有重复的回答),即使它们不如较短的答案清晰、高质量或准确。Image
  3. 自我增强偏见:LLM 可能更喜欢他们自己生成的答案。
  4. 对数学和推理问题评分能力有限:众所周知,LLMs 在数学和推理方面的能力有限,因此无法对这些问题进行评分,因为它们不知道正确答案。然而,更有趣的是,它还显示出对它可以解决的基本数学问题的评分也有限制。下图展示了 GPT-4 对一个简单的数学问题做出错误判断的一个例子。尽管 GPT-4 可以单独回答这个问题,但它被提供的答案误导了,最终导致了错误的判断。Image

针对这些问题,论文也提出了如下解决方案:

  1. 交换答案顺序:通过简单地将两个答案的位置互换,并要求LLM评委重新评估。如果结果不一致,则判定为平局。实验表明这种方法能够显著减少位置偏差。
  2. 随机分配位置:在大规模评估中,可以通过随机分配答案位置来进一步减少位置偏差的影响。这种方法在大规模应用中更为有效,因为它消除了任何潜在的顺序偏好。
  3. 参考引导评判:首先独立生成 LLM 评委的答案,然后将其作为判分提示中的参考答案。该方法可以显著提高 LLM 在评分数学和推理问题上的能力。如下表所示,相对于默认提示和CoT,该方法显著降低了失败率(从 70% 降低到 15%)。Image
  4. 微调评估模型。在 Arena 数据集上对 Vicuna-13B 进行了微调,以充当裁判,结果表明微调能显著提高LLM的评估能力。Image