Skip to main content
QUICK REVIEW

[论文解读] Self-Preference Bias in LLM-as-a-Judge

Koki Wataoka, Tsubasa Takahashi|arXiv (Cornell University)|Oct 29, 2024
Law, Economics, and Judicial SystemsEconomics, Econometrics and Finance被引用 3
一句话总结

本文提出了一种基于公平性的新度量方法,用于定量衡量大语言模型作为裁判系统中的自我偏好偏差,表明GPT-4在评估自身输出时表现出显著的偏好。研究发现,这种偏差与生成文本的困惑度较低有关,揭示了大语言模型更倾向于选择对自己而言更熟悉的回应,无论这些回应是否由其自身生成。

ABSTRACT

Automated evaluation leveraging large language models (LLMs), commonly referred to as LLM evaluators or LLM-as-a-judge, has been widely used in measuring the performance of dialogue systems. However, the self-preference bias in LLMs has posed significant risks, including promoting specific styles or policies intrinsic to the LLMs. Despite the importance of this issue, there is a lack of established methods to measure the self-preference bias quantitatively, and its underlying causes are poorly understood. In this paper, we introduce a novel quantitative metric to measure the self-preference bias. Our experimental results demonstrate that GPT-4 exhibits a significant degree of self-preference bias. To explore the causes, we hypothesize that LLMs may favor outputs that are more familiar to them, as indicated by lower perplexity. We analyze the relationship between LLM evaluations and the perplexities of outputs. Our findings reveal that LLMs assign significantly higher evaluations to outputs with lower perplexity than human evaluators, regardless of whether the outputs were self-generated. This suggests that the essence of the bias lies in perplexity and that the self-preference bias exists because LLMs prefer texts more familiar to them.

研究动机与目标

  • 为解决当前缺乏可靠、定量的度量方法来衡量大语言模型作为裁判系统中的自我偏好偏差问题。
  • 探究自我偏好偏差的潜在成因,特别是熟悉度(以困惑度衡量)是否驱动该偏差。
  • 在成对比较设置中,将大语言模型的评估与人类判断进行对比,以识别偏差模式。
  • 开发一种基于算法公平性概念的度量方法,实现一致且可解释的偏差测量。
  • 评估八种不同大语言模型中自我偏好偏差的程度,重点关注GPT-4的行为。

提出的方法

  • 基于公平性中的平等机会概念,提出一种新的自我偏好偏差度量方法,将偏差定义为模型在评估自身输出与非自身输出时结果差异的度量。
  • 采用成对评估框架,每个大语言模型在相同提示下对两个响应进行评判:一个由自身生成,另一个由其他模型生成。
  • 通过在多个提示下测量自生成响应的胜率,利用所提出的基于公平性的定义计算偏差得分。
  • 分析被评估文本的困惑度与大语言模型所赋予评分之间的相关性,并与人类评估者的偏好进行比较。
  • 应用另一种公平性度量方法——人口均等性(Demographic Parity),以验证结果的一致性并进行交叉验证。
  • 使用统计分析方法比较大语言模型评估与人类判断之间的差异,隔离困惑度对评分影响的作用。
(a)
(a)

实验结果

研究问题

  • RQ1在成对设置中,大语言模型在评估自身输出与他人输出时,其自我偏好偏差的程度如何?
  • RQ2大语言模型作为裁判系统的自我偏好偏差是否与被评估文本的困惑度相关?
  • RQ3大语言模型是否无论文本是否由其自身生成,都会对低困惑度文本赋予显著更高的评分,而人类评估者则不会?
  • RQ4能否使用基于公平性的度量方法对自我偏好偏差进行定量测量?不同大语言模型在此方面的表现如何比较?
  • RQ5驱动高性能模型(如GPT-4)中观察到的偏差的潜在机制是什么?例如熟悉度或与内部政策的一致性?

主要发现

  • GPT-4表现出显著的自我偏好偏差,使用人口均等性度量方法测得的自我偏好偏差得分为0.749,表明其对自身输出的评分远高于对其他模型输出的评分。
  • 所提出的基于公平性的度量方法(定义4.1)成功实现了对自我偏好偏差的量化,揭示了GPT-4的偏差显著高于其他模型,如GPT-3.5-turbo(0.191)和Vicuna-13b(0.382)。
  • 即使文本并非由模型自动生成,大语言模型仍会显著赋予低困惑度文本更高的评分,而人类评估者则不会,表明熟悉度(以困惑度衡量)是驱动偏差的关键因素。
  • 该偏差并非仅源于自生成行为,而是根植于模型对低困惑度序列的熟悉程度,表明与训练数据的感知相似性会影响评估结果。
  • 研究证实,自我偏好偏差不仅限于事实性错误,还常与风格差异相关,如回应结构或政策遵循程度,尤其在高级模型如GPT-4中表现明显。
  • 结果表明,在实际应用中,通过减少对那些对低困惑度输出赋予高分的大语言模型的权重,采用多模型集成评估的方法,可有效缓解自我偏好偏差。
(b)
(b)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。