Skip to main content
QUICK REVIEW

[论文解读] Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge

Lin Shi, Weicheng Ma|arXiv (Cornell University)|Jun 12, 2024
Legal Education and Practice Innovations被引用 4
一句话总结

本文系统研究了 LLM-as-a-Judge 系统中的位置偏差问题,即模型在成对比较中倾向于根据响应在提示中的顺序而非质量做出判断。通过在 9 种裁判模型和 22 项任务上使用位置一致性与公平性等指标的框架,研究发现偏差存在显著差异——GPT-4 展现出极强的一致性与公平性,而成本更低的模型如 GPT-3.5 在部分任务中表现相当,凸显了成本、一致性与公平性之间的权衡。

ABSTRACT

LLM-as-a-Judge has emerged as a promising alternative to human evaluators across various tasks, yet inherent biases - particularly position bias, the tendency to favor solutions based on their position within the prompt - compromise its reliability. This exploratory study evaluates position bias in LLM judges across pairwise and list-wise comparison settings, introducing three metrics: repetition stability, position consistency, and preference fairness. Our experiments, involving 15 LLM judges across MTBench and DevBench with 22 tasks and approximately 40 solution-generating models, result in over 150,000 evaluation instances. We identify Judge-Level, Candidate-Level, and Task-Level factors contributing to bias. The findings confirm that position bias is not due to random chance and varies significantly across judges and tasks. While position bias is weakly influenced by the length of prompt components, it is strongly affected by the quality gap between solutions. Our agreement and disagreement analysis among judges further provides insights into the distribution of judging difficulty across the dataset, and highlights the potential for dataset modifications.

研究动机与目标

  • 调查并量化 LLM-as-a-Judge 系统中的位置偏差,即模型判断系统性地偏好基于其在提示中位置的响应。
  • 开发一个标准化框架,包含重复一致性、位置一致性与位置公平性等指标,以评估和比较不同裁判模型的偏差。
  • 分析模型族、任务类型以及答案质量差距对位置偏差的影响,并评估长度或冗长度偏差是否驱动偏好。
  • 为选择最优裁判模型和改进基准设计提供可操作的见解,最终提升自动化 LLM 评估的可靠性。
  • 为未来在基于 LLM 的评估系统中研究去偏策略奠定术语与指标基础。

提出的方法

  • 设计了一个系统化的评估框架,通过成对比较评估方式测量位置偏差,即对两个响应在原始顺序与交换顺序下均进行评估。
  • 定义关键指标:重复一致性(在重复评估中判断的稳定性)、位置一致性(对第一个或第二个响应的偏好)与位置公平性(在不同位置间偏好平衡)。
  • 将位置偏好得分、首因/近因偏好与答案质量差距等术语操作化,以在不同模型与任务间实现偏差分析的标准化。
  • 在来自 MTBench 与 DevBench 的 22 项任务上,对 9 种 LLM 裁判模型(GPT-3.5、GPT-4、GPT-4-Turbo、Claude-3、Gemini-Pro)进行了实验,生成约 80,000 个评估实例。
  • 应用普通最小二乘法(OLS)回归,分析任务层面因素(如输入长度、输出长度与提示长度)对位置一致性和偏好影响。
  • 可视化并分析长度统计与偏差之间的关系,结论为长度效应微弱,观察到的冗长度偏差更可能源于位置偏差与质量差距。

实验结果

研究问题

  • RQ1LLM 裁判在成对比较评估中在多大程度上表现出位置偏差?这种偏差在不同模型族与任务间如何变化?
  • RQ2位置一致性、公平性与重复一致性等指标与模型性能及内在属性(如上下文窗口与架构)之间的相关性如何?
  • RQ3响应长度或冗长度是否独立驱动偏好?还是观察到的偏差更可由位置排序与答案质量差距解释?
  • RQ4答案质量差距如何影响 LLM 判断的一致性与公平性,特别是在响应质量相近的情况下?
  • RQ5在特定评估任务中,成本更低的 LLM 是否能实现与 GPT-4 等高成本模型相当甚至更优的公平性与一致性?

主要发现

  • 位置偏差具有系统性且可复现:80% 的判断在重复评估中表现出一致偏好,表明其并非随机所致,而是模型特异性结构特征的结果。
  • GPT-4 展现出最高的位置一致性(0.92)与公平性(0.51),尽管部分更便宜的模型如 GPT-3.5 在特定任务中表现出相当或更优的公平性。
  • 家族级模型特性显著影响偏差:GPT 系列模型表现出强一致性与公平性,而 Claude-3 模型则显示出明显的近因偏好(对第二个响应的偏好更高)。
  • 位置一致性与答案质量差距成正比——当响应质量相近时,判断的一致性降低,凸显了细粒度评估的挑战。
  • 基于长度的偏差(如偏好更长响应)并非独立显著因素;相反,它们被纳入位置偏差范畴,表明长度偏好实为质量偏差的代理指标。
  • OLS 回归显示,任务特定因素(如 UML 类设计)对位置偏好具有统计显著影响(p < 0.05),而 GPT-4-Turbo 等模型族效应呈现负向偏差(β = -0.0036,p = 0.015),表明对第二个响应存在轻微偏好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。