Skip to main content
QUICK REVIEW

[论文解读] Don't Use LLMs to Make Relevance Judgments

Ian Soboroff|arXiv (Cornell University)|Sep 23, 2024
Artificial Intelligence in Law被引用 4
一句话总结

本文反对在TREC风格的信息检索评估中使用大语言模型(LLMs)生成相关性判断。它表明,此类由LLM生成的判断会形成性能上限,导致无法衡量表现优于模型的系统,并由于自指偏差和模型崩溃而导致评估结果失真。

ABSTRACT

Making the relevance judgments for a TREC-style test collection can be complex and expensive. A typical TREC track usually involves a team of six contractors working for 2-4 weeks. Those contractors need to be trained and monitored. Software has to be written to support recording relevance judgments correctly and efficiently. The recent advent of large language models that produce astoundingly human-like flowing text output in response to a natural language prompt has inspired IR researchers to wonder how those models might be used in the relevance judgment collection process. At the ACM SIGIR 2024 conference, a workshop ``LLM4Eval'' provided a venue for this work, and featured a data challenge activity where participants reproduced TREC deep learning track judgments, as was done by Thomas et al (arXiv:2408.08896, arXiv:2309.10621). I was asked to give a keynote at the workshop, and this paper presents that keynote in article form. The bottom-line-up-front message is, don't use LLMs to create relevance judgments for TREC-style evaluations.

研究动机与目标

  • 挑战将大语言模型用于生成TREC风格评估相关性判断的日益增长的趋势。
  • 揭示在信息检索评估中将大语言模型作为真实标准来源的根本缺陷,即模型输出成为真实标准。
  • 证明此类方法将评估限制在表现劣于大语言模型的系统上,从而形成性能上限。
  • 论证使用大语言模型生成相关性判断会导致评估过程中的模型崩溃,类似于自监督学习中的分布崩溃。
  • 倡导大语言模型在评估中的替代用途,这些用途不涉及生成真实标准,例如质量控制或支持用户研究。

提出的方法

  • 分析使用大语言模型生成相关性判断的后果,将模型输出视为评估的真实标准。
  • 将基于大语言模型的相关性判断生成与自监督学习中的模型崩溃概念进行类比,即因模型自身输出的反馈而导致性能下降。
  • 将此方法与既有的评估实践(如合并池法)进行对比,后者通过人类评估员对多个系统的结果进行评估,以构建更稳健、更全面的相关性池。
  • 提出大语言模型可在不生成真实标准的前提下支持评估流程,例如用于检测人类判断中的错误或辅助用户研究设计。
  • 强调当大语言模型在真实人类相关性判断数据上进行微调后,可作为特权评估者,从而实现对系统性能更公平的测量。
  • 强调评估不应对大语言模型定义真实标准,而应基于人类标注的相关性数据,即使大语言模型在辅助角色中发挥作用(如增强数据)。
Figure 1: Sample result from [ 12 ] , TREC-8, TREC-style pooling to depth 100.
Figure 1: Sample result from [ 12 ] , TREC-8, TREC-style pooling to depth 100.

实验结果

研究问题

  • RQ1在信息检索评估中使用大语言模型生成相关性判断会产生哪些后果?
  • RQ2为何在评估中将大语言模型作为真实标准来源会为被测量系统设置性能上限?
  • RQ3基于大语言模型的相关性判断生成如何导致评估过程中的模型崩溃?
  • RQ4如果大语言模型不用于生成真实标准,它们在信息检索评估中是否仍具实用性?
  • RQ5大语言模型在不损害评估完整性的情况下,可在评估流程中扮演哪些替代角色?

主要发现

  • 使用大语言模型生成相关性判断会形成性能上限,因为无法评估表现优于大语言模型自身输出的系统。
  • 当用于生成相关性判断的大语言模型本身也是被评估系统的一部分时,该系统即使在输出上优于大语言模型,也会显得表现不佳。
  • 在这些评估中,较新的大语言模型总是会表现得比旧模型差,仅仅是因为它们检索到了此前未被判断或判断错误的文档。
  • 这种评估设置会导致一种形式的模型崩溃,即评估指标因模型自身输出的反馈而退化。
  • 如果大语言模型用于支持人类评估员(例如用于错误检测或自动化用户研究组件),它们在不生成真实标准的前提下仍具实用性。
  • 在人类相关性判断数据上微调大语言模型后,可使其作为特权评估者,从而在避免自指判断生成缺陷的前提下,实现对系统性能更公平的测量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。