[论文解读] Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement
本文提出级联选择性评估(Cascaded Selective Evaluation),通过基于置信度估计动态选择裁判模型,确保大语言模型(LLM)配对评估中的人类一致性。利用模拟标注者(Simulated Annotators)进行校准的置信度评分,该方法在79.1%的覆盖率下实现超过80%的人类一致性,优于GPT-4,同时将成本降低高达87.4%。
We present a principled approach to provide LLM-based evaluation with a rigorous guarantee of human agreement. We first propose that a reliable evaluation method should not uncritically rely on model preferences for pairwise evaluation, but rather assess the confidence of judge models and selectively decide when to trust its judgement. We then show that under this selective evaluation framework, human agreement can be provably guaranteed -- such that the model evaluation aligns with that of humans to a user-specified agreement level. As part of our framework, we also introduce Simulated Annotators, a novel confidence estimation method that significantly improves judge calibration and thus enables high coverage of evaluated instances. Finally, we propose Cascaded Selective Evaluation, where we use cheaper models as initial judges and escalate to stronger models only when necessary -- again, while still providing a provable guarantee of human agreement. Experimental results show that Cascaded Selective Evaluation guarantees strong alignment with humans, far beyond what LLM judges could achieve without selective evaluation. For example, on a subset of Chatbot Arena where GPT-4 almost never achieves 80% human agreement, our method, even while employing substantially cost-effective models such as Mistral-7B, guarantees over 80% human agreement with almost 80% test coverage.
研究动机与目标
- 为解决LLM评估中缺乏可证明的可靠性问题,该问题通常不加批判地依赖模型偏好而缺乏置信度评估。
- 开发一个框架,确保在用户指定的风险水平α下实现与人类的一致性,保证模型判断与人类共识一致。
- 在缺乏外部监督的情况下,改进LLM裁判的置信度估计,以在不牺牲可靠性的情况下最大化评估覆盖率。
- 通过级联更便宜的模型并在置信度较低时才升级,降低评估成本,同时保持与人类判断的高一致性。
- 证明在采用选择性评估和适当的置信度校准后,性能更弱但成本更低的模型(如GPT-3.5)可超越更强的模型(如GPT-4)
提出的方法
- 提出选择性评估作为框架,仅当LLM裁判对偏好判断的置信度足够高时才被信任,依据的是经过校准的置信度估计。
- 引入模拟标注者(Simulated Annotators)——一种新颖的无监督置信度估计方法,通过上下文学习模拟多样化的标注者偏好,并将置信度计算为模拟结果中的一致比率。
- 在小规模校准集上应用固定序列检验(Bauer, 1991),推导出不一致风险的可证明上界,确保人类一致性的概率≥1−α。
- 设计级联选择性评估,其中更便宜的模型(如Mistral-7B)作为初始裁判;若置信度较低,则将实例升级至更强的模型,同时保持人类一致性的保证。
- 自动根据用户指定的风险容忍度α确定最优弃权策略,无需依赖启发式模型选择。
- 采用模型无关的方法,只要置信度得到适当估计和校准,任何LLM均可作为裁判使用。

实验结果
研究问题
- RQ1即使使用性能更弱或成本更低的模型,LLM评估能否在用户指定的置信度水平下保证与人类判断的一致性?
- RQ2在不依赖外部监督或标注数据的情况下,如何改进LLM裁判的置信度估计?
- RQ3级联评估框架能否在保持或提升人类一致性的同时降低推理成本,相较于仅使用最强模型?
- RQ4基于校准置信度的弃权策略是否与人类对主观性的感知一致,而非依赖于长度或重叠等浅层启发式特征?
- RQ5模拟标注者能否在校准性和失败预测方面优于传统置信度估计方法(如预测概率)?
主要发现
- 级联选择性评估在Chatbot Arena基准上保证了超过80%的人类一致性,即使仅使用Mistral-7B和GPT-3.5作为裁判,其表现优于未启用弃权机制的GPT-4。
- 该方法在Chatbot Arena上实现了79.1%的测试覆盖率,同时保持超过80%的人类一致性,显著优于未启用弃权机制的GPT-4(77.8%一致性)。
- 使用更弱的级联模型(Mistral-7B、Mixtral-8×7B、GPT-3.5),该框架相比GPT-4将评估成本降低了87.4%,同时仍实现80.3%的人类一致性。
- 与基线方法(如预测概率)相比,模拟标注者显著提升了置信度校准效果和失败预测能力,后者往往高估人类一致性。
- 弃权策略与人类对主观性的感知高度一致,而非依赖于长度比或标记重叠等浅层启发式方法。
- 该框架通过在校准集上应用固定序列检验,提供了人类一致性的可证明保证,确保任何未见实例的不一致概率均被控制在α以内。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。