Skip to main content
QUICK REVIEW

[论文解读] LLMs Can Patch Up Missing Relevance Judgments in Evaluation

Shivani Upadhyay, Ehsan Kamalloo|arXiv (Cornell University)|May 8, 2024
Artificial Intelligence in Law被引用 4
一句话总结

本文提出了一种框架,利用大语言模型(LLMs)自动预测信息检索基准中未标注文档(“空缺”)的细粒度相关性判断。通过使用详细指令和少样本示例提示LLMs,该方法即使仅保留10%的真实相关性判断,也能与人工标注的相关性判断保持高度相关性(肯德尔等级相关系数τ为0.87–0.92),显著优于将所有空缺文档简单标记为不相关的方法。

ABSTRACT

Unjudged documents or holes in information retrieval benchmarks are considered non-relevant in evaluation, yielding no gains in measuring effectiveness. However, these missing judgments may inadvertently introduce biases into the evaluation as their prevalence for a retrieval model is heavily contingent on the pooling process. Thus, filling holes becomes crucial in ensuring reliable and accurate evaluation. Collecting human judgment for all documents is cumbersome and impractical. In this paper, we aim at leveraging large language models (LLMs) to automatically label unjudged documents. Our goal is to instruct an LLM using detailed instructions to assign fine-grained relevance judgments to holes. To this end, we systematically simulate scenarios with varying degrees of holes by randomly dropping relevant documents from the relevance judgment in TREC DL tracks. Our experiments reveal a strong correlation between our LLM-based method and ground-truth relevance judgments. Based on our simulation experiments conducted on three TREC DL datasets, in the extreme scenario of retaining only 10% of judgments, our method achieves a Kendall tau correlation of 0.87 and 0.92 on an average for Vicuña-7B and GPT-3.5 Turbo respectively.

研究动机与目标

  • 为解决信息检索测试集因相关性判断不完整而引入的偏差问题,即未标注文档被视作不相关,从而扭曲评估指标。
  • 通过使用LLMs自动预测未标注文档的相关性标签,减少对昂贵且耗时的人工标注的依赖。
  • 开发一种稳健的、基于指令的LLM框架,能够分配细粒度相关性判断(如TREC风格标签),而非二值标签。
  • 评估LLMs在不同缺失判断程度下的有效性,模拟真实基准中的“空缺”情况。
  • 通过在未见过的数据集(如TREC DL 2023)上测试,确保方法不包含数据泄露。

提出的方法

  • 作者通过从TREC DL 2019、2020和2021数据集中随机移除90%的真实相关性判断,模拟不完整的测试集,从而在判断数据中制造出‘空缺’。
  • 采用提示工程策略,指导LLMs(Vicuña-7B和GPT-3.5 Turbo)基于详细指令和少样本示例,为未标注的查询-文档对分配细粒度相关性标签(例如0至3)。
  • LLM评估器接收一个结构化提示,其中包含查询、文档文本以及根据TREC指南明确定义的相关性等级。
  • 使用肯德尔等级相关系数τ(Kendall’s τ)评估LLM预测判断与真实判断之间的相关性,这是衡量排名一致性的标准指标。
  • 在零样本和少样本提示设置下测试该方法,以比较性能与方差。
  • 通过将LLM应用于未在训练中使用过的TREC DL 2023 qrels,测试数据污染问题,以排除数据泄露的可能性。

实验结果

研究问题

  • RQ1LLMs能否准确预测信息检索测试集中未标注文档的细粒度相关性判断?
  • RQ2LLM-based判断预测的性能如何随相关性判断缺失程度的增加而变化?
  • RQ3与零样本提示相比,少样本提示在与人工判断的相关性及稳定性方面是否表现更优?
  • RQ4LLMs能否在未见过的数据集上泛化,且不因数据泄露而影响可靠性?
  • RQ5LLM修补后的评估与将未标注文档视为不相关的基线方法相比如何?

主要发现

  • 当仅保留10%的相关性判断时,Vicuña-7B在TREC DL 2019上的真实判断相关性达到肯德尔τ为0.862,GPT-3.5 Turbo则达到0.927。
  • 基于LLM的方法显著优于将所有空缺文档标记为不相关的基线方法(τ = 0.624),平均相关性提升25–30%。
  • 少样本提示相比零样本提示表现出更高的相关性和更低的方差,结果更稳定。
  • 该框架在未见过的数据上保持强劲性能,如在TREC DL 2023上使用LLM修补的qrels评估BM25,nDCG@10达到0.2721(GPT-3.5 Turbo),接近真实值0.2627。
  • 该方法展现出强大的泛化能力,在所有三个TREC DL赛道上,即使在极端空缺条件下(90%缺失),肯德尔τ值仍高于0.87。
  • 数据污染测试表明,LLMs并未简单记忆测试数据,因为在未用于提示或微调的TREC DL 2023上性能依然强劲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。