Skip to main content
QUICK REVIEW

[논문 리뷰] Don't Use LLMs to Make Relevance Judgments

Ian Soboroff|arXiv (Cornell University)|2024. 09. 23.
Artificial Intelligence in Law인용 수 4
한 줄 요약

이 논문은 TREC 스타일의 정보 검색 평가에서 대규모 언어 모델(Large Language Models, LLMs)을 사용해 관련성 평가를 생성하는 것에 반대한다. 연구는 LLM에 의해 생성된 평가가 성능의 상한선을 만들며, 모델보다 우수한 성능을 내는 시스템을 측정할 수 없게 하고, 자기참조적 편향과 모델 붕괴로 인해 잘못된 평가를 초래함을 입증한다.

ABSTRACT

Making the relevance judgments for a TREC-style test collection can be complex and expensive. A typical TREC track usually involves a team of six contractors working for 2-4 weeks. Those contractors need to be trained and monitored. Software has to be written to support recording relevance judgments correctly and efficiently. The recent advent of large language models that produce astoundingly human-like flowing text output in response to a natural language prompt has inspired IR researchers to wonder how those models might be used in the relevance judgment collection process. At the ACM SIGIR 2024 conference, a workshop ``LLM4Eval'' provided a venue for this work, and featured a data challenge activity where participants reproduced TREC deep learning track judgments, as was done by Thomas et al (arXiv:2408.08896, arXiv:2309.10621). I was asked to give a keynote at the workshop, and this paper presents that keynote in article form. The bottom-line-up-front message is, don't use LLMs to create relevance judgments for TREC-style evaluations.

연구 동기 및 목표

  • TREC 스타일 평가에서 LLM을 사용해 관련성 평가를 생성하는 경향이 증가하고 있는 데에 도전하기 위해.
  • LLM을 정보 검색 평가의 진리 기준으로 삼는 데서 기인하는 근본적 결함을 드러내기 위해, 즉 모델의 출력이 기준 평가가 되는 상황에서의 문제를 폭 드러내기 위해.
  • LLM이 생성한 평가를 기반으로 한 평가 방식이 시스템 성능을 LLM 이하로만 측정할 수 있도록 제한함으로써 성능의 상한선을 만들며, 이에 대한 근거를 제시하기 위해.
  • LLM이 관련성 평가를 생성할 경우 평가 과정에서 모델 붕괴가 발생하며, 이는 자기지도 학습에서의 분포 붕괴와 유사하다는 점을 주장하기 위해.
  • 기준 평가를 생성하지 않는 LLM의 대안적 활용 방안을 주장하기 위해, 예를 들어 품질 제어나 사용자 연구 지원과 같은 역할을 통해 평가 과정을 지원하는 방식을 제안하기 위해.

제안 방법

  • LLM이 관련성 평가를 생성하는 방식을 분석하고, 모델의 출력을 평가의 기준 평가로 간주하는 방식을 적용한다.
  • LLM 기반 관련성 평가 생성 방식과 자기지도 학습에서의 모델 붕괴 개념 간 유사성을 도출한다. 여기서 성능 저하는 모델 자체의 출력에 기반한 피드백으로 인해 악화된다.
  • 이러한 접근 방식을 풀링과 대조한다. 풀링은 여러 시스템의 문서를 인간 평가자가 평가하여 더 견고하고 포괄적인 관련성 풀을 만드는 기존의 평가 관행이다.
  • LLM이 기준 평가를 생성하지 않는 한, 평가를 지원하는 데 활용될 수 있음을 제안한다. 예를 들어 인간 평가자의 오류를 탐지하거나 사용자 연구 설계를 보조하는 데 사용할 수 있다.
  • LLM이 실제 인간의 관련성 평가 데이터에 맞춰 미세조정된 경우, 이는 특권 평가자(privileged evaluator)로 기능할 수 있으며, 이는 시스템 성능 측정을 공정하게 가능하게 한다는 점을 강조한다.
  • 평가 과정이 LLM이 정의한 진리에 의존해서는 안 되며, 오히려 인간이 애너테이션한 관련성 데이터를 기반으로 해야 하며, LLM은 보조적 역할을 통해 이를 보완할 수 있어야 한다는 점을 강조한다.
Figure 1: Sample result from [ 12 ] , TREC-8, TREC-style pooling to depth 100.
Figure 1: Sample result from [ 12 ] , TREC-8, TREC-style pooling to depth 100.

실험 결과

연구 질문

  • RQ1LLM을 사용해 관련성 평가를 생성하는 것이 정보 검색 평가에 어떤 영향을 미치는가?
  • RQ2LLM을 평가의 진리 기준으로 삼을 경우, 측정되는 시스템의 성능에 상한선이 생기는 이유는 무엇인가?
  • RQ3LLM 기반 관련성 평가 생성 방식이 평가 과정에서 어떻게 모델 붕괴를 유도하는가?
  • RQ4LLM이 기준 평가를 생성하지 않는 한, 여전히 정보 검색 평가에서 유용한가?
  • RQ5기준 평가의 무결성을 훼손하지 않으면서 LLM이 평가 파이프라인에서 어떤 보조 역할을 할 수 있는가?

주요 결과

  • LLM이 관련성 평가를 생성할 경우, 시스템의 성능이 LLM 자체의 출력을 초월할 수 없게 되어 성능의 상한선이 생긴다.
  • LLM이 평가 대상 시스템에 포함되어 있는 경우, 시스템은 LLM의 출력을 초월하는 성능을 내더라도 실제로는 성능이 열등한 것처럼 보일 수 있다.
  • 최신 LLM은 항상 이전 버전의 LLM보다 평가에서 성능이 열 劣하게 나타나며, 이는 이전에 평가되지 않았거나 잘못 평가된 문서를 검색하기 때문일 뿐이다.
  • 이러한 평가 설정은 모델의 자체 출력에 기반한 피드백으로 인해 평가 지표가 악화되는 형태의 모델 붕괴를 유도한다.
  • LLM이 기준 평가를 생성하지 않는 한, 인간 평가자를 지원하는 데서는 여전히 평가에 활용될 수 있다. 예를 들어 오류 탐지나 사용자 연구 구성 요소의 자동화에 활용할 수 있다.
  • LLM을 인간의 관련성 평가 데이터에 맞춰 미세조정하면, 이는 특권 평가자로 기능할 수 있으며, 자기참조적 평가 생성의 결함 없이도 공정한 시스템 성능 측정을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.