[论文解读] Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge
本文提出了一套严格的统计框架,采用麦克唐纳的omega系数评估大语言模型作为裁判系统内部一致性可靠性。研究发现,即使在固定温度设置下,单次推理的大语言模型裁判结果仍表现出显著的变异性,因此可靠性度量在人工智能安全和内容审核等高风险应用中对于可信评估至关重要。
Large Language Models (LLMs) have become increasingly powerful and ubiquitous, but their stochastic nature poses challenges to the reliability of their outputs. While deterministic settings can improve consistency, they do not guarantee reliability, as a single sample from the model's probability distribution can still be misleading. Building upon the concept of LLM-as-a-judge, we introduce a novel framework for rigorously evaluating the reliability of LLM judgments, leveraging McDonald's omega. We evaluate the reliability of LLMs when judging the outputs of other LLMs on standard single-turn and multi-turn benchmarks, simultaneously investigating the impact of temperature on reliability. By analyzing these results, we demonstrate the limitations of fixed randomness and the importance of considering multiple samples, which we show has significant implications for downstream applications. Our findings highlight the need for a nuanced understanding of LLM reliability and the potential risks associated with over-reliance on single-shot evaluations. This work provides a crucial step towards building more trustworthy and reliable LLM-based systems and applications.
研究动机与目标
- 为解决在内容审核等高风险应用中评估大语言模型作为裁判系统可靠性方面的关键空白。
- 挑战固定温度设置(即确定性配置)可确保大语言模型裁判结果可靠的假设。
- 引入麦克唐纳的omega作为量化大语言模型裁判结果内部一致性可靠性的稳健、统计基础坚实的度量指标。
- 证明即使可靠性值较高,也无法消除在复杂、多轮任务中跨重复实验的变异性。
- 倡导在报告大语言模型作为裁判的结果时一并报告可靠性度量,以提升人工智能评估的透明度和可信度。
提出的方法
- 采用麦克唐纳的omega作为主要可靠性度量指标,量化同一输入下多个大语言模型裁判结果的内部一致性。
- 将该框架应用于标准的单轮和多轮基准测试,包括BBH、SQuAD、MT-Bench和Head-to-Tail。
- 在不同温度设置下评估大语言模型裁判输出的可靠性,以检验其对随机性的敏感性,即使在确定性配置下亦如此。
- 对每个输入收集多次裁判结果以计算可靠性分数,模拟重复评估以捕捉变异性。
- 使用统计推断报告大语言模型裁判结果中的不确定性,类似于传统研究中的置信区间。
- 比较不同基准和任务类型下的可靠性分数,以识别裁判结果不稳定的模式。
实验结果
研究问题
- RQ1在固定温度设置下,大语言模型裁判结果在多次运行中有多可靠,尽管其配置是确定性的?
- RQ2温度在不同类型的基准测试中如何影响大语言模型作为裁判输出的可靠性?
- RQ3麦克唐纳的omega能否有效量化主观且复杂的评估任务中大语言模型裁判结果的内部一致性可靠性?
- RQ4可靠性分数与下游大语言模型评估结果中观察到的变异性之间有何相关性?
- RQ5低可靠性对人工智能安全和内容审核等现实应用有何影响?
主要发现
- 即使在固定温度设置下,大语言模型作为裁判的输出在多次重复中仍表现出显著变异性,表明确定性配置并不能保证可靠性。
- 通过麦克唐纳的omega计算出的可靠性分数在不同基准之间存在显著差异,其中多轮和复杂任务的可靠性明显较低。
- 高可靠性值并不能消除下游输出的变异性,如图3所示,即使可靠性高的模型在多次运行中仍产生不一致的裁判结果。
- 本研究发现,单次评估不足以建立对大语言模型裁判结果的信任,尤其是在主观或高风险领域。
- 应在报告大语言模型作为裁判的结果时一并报告可靠性度量,以向用户揭示模型输出中固有的不确定性。
- 该框架表明,可靠性是大语言模型评估中一个关键且可量化的维度,必须整合到研究和部署实践中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。