Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Yes and No: Improving Zero-Shot LLM Rankers via Scoring Fine-Grained Relevance Labels

Honglei Zhuang, Zhen Qin|arXiv (Cornell University)|2023. 10. 21.
Text and Document Classification Technologies인용 수 7
한 줄 요약

이 논문은 이진 관련성 프롬프트(예/아니요) 대신 '매우 관련성 있음', '약간 관련성 있음', '관련 없음'과 같은 세분화된 관련성 레이블을 사용하여 제로샷 LLM 랭커를 향상시키는 방법을 제안한다. LLM이 이러한 중간 레이블에 대한 가능성도를 할당하고 이를 종합하여 랭킹 점수로 변환함으로써, 8개의 BEIR 데이터셋에서 랭킹 성능이 크게 향상되었으며, 5단계 등급 체계를 사용할 경우 평균 NDCG@10가 0.5022로 상승하였다.

ABSTRACT

Zero-shot text rankers powered by recent LLMs achieve remarkable ranking performance by simply prompting. Existing prompts for pointwise LLM rankers mostly ask the model to choose from binary relevance labels like "Yes" and "No". However, the lack of intermediate relevance label options may cause the LLM to provide noisy or biased answers for documents that are partially relevant to the query. We propose to incorporate fine-grained relevance labels into the prompt for LLM rankers, enabling them to better differentiate among documents with different levels of relevance to the query and thus derive a more accurate ranking. We study two variants of the prompt template, coupled with different numbers of relevance levels. Our experiments on 8 BEIR data sets show that adding fine-grained relevance labels significantly improves the performance of LLM rankers.

연구 동기 및 목표

  • 제로샷 LLM 랭커에서 이진 관련성 프롬프트의 한계를 해결하기 위해, 부분적으로 관련된 문서를 구분하지 못하는 문제를 해결하고자 한다.
  • 중간 관련성 레이블을 제공함으로써 모델이 문서의 관련성 수준을 더 잘 구분할 수 있는지 조사하고자 한다.
  • 다양한 관련성 수준의 수와 레이블 형식(텍스트형 vs. 등급 체계)이 랭킹 성능에 미치는 영향을 평가하고자 한다.
  • LLM 가능성도를 종합하여 최종 랭킹 점수로 변환하는 다양한 점수 도출 전략을 비교하고자 한다.

제안 방법

  • 이진 '예' 또는 '아니요' 대신 '매우 관련성 있음', '약간 관련성 있음', '관련 없음'과 같은 다수의 관련성 레이블 옵션을 LLM에 프롬프트로 제공한다.
  • 각 관련성 레이블에 대한 LLM의 가능성도를 사용하여 피크 가능성도 또는 기대 관련성(경계 확률)을 통해 최종 랭킹 점수를 계산한다.
  • 두 가지 프롬프트 유형을 평가한다: 텍스트 기반 세분화된 레이블(RG-3L 등)과 정수 척도를 사용하는 등급 체계 프롬프트(RG-S(0,4) 등, 0에서 k까지의 정수 척도).
  • 다양한 관련성 수준에 걸쳐 가능성도를 종합하여 세분화된 관련성 평가를 반영하는 연속형 랭킹 점수를 생성한다.
  • 피크 가능성도와 기대 관련성(경계 확률)을 사용한 두 가지 점수 도출 방법을 비교한다.
  • 표준 정보 검색 메트릭(예: NDCG@10)을 사용하여 8개의 BEIR 벤치마크 데이터셋에서 성능을 평가한다.
(a) Yes-No relevance generation
(a) Yes-No relevance generation

실험 결과

연구 질문

  • RQ1이중 관련성 프롬프트(예/아니요) 대비 중간 관련성 레이블을 프롬프트에 통합함으로써 제로샷 랭킹 성능이 향상되는가?
  • RQ2관련성 수준의 수가 LLM 랭커 성능에 어떤 영향을 미치는가?
  • RQ3텍스트 레이블(예: '약간 관련성 있음')과 등급 체계 프롬프트(예: 0–4) 중 어느 것이 더 나은 랭킹 결과를 낳는가?
  • RQ4LLM 가능성도를 종합하는 데서 피크 가능성도 전략과 기대 관련성 전략 중 어느 것이 더 뛰어난 랭킹 점수를 생성하는가?
  • RQ5실제 레이블이 이진인 데이터셋에서도 세분화된 프롬프트가 랭킹 성능 향상에 기여하는가?

주요 결과

  • 3단계 텍스트 관련성 레이블(RG-3L)을 사용할 경우 평균 NDCG@10가 0.4992로 상승하였고, 5단계 등급 체계(RG-S(0,4))를 사용할 경우 0.5022로 더욱 향상되어 이진 프롬프트보다 일관되게 성능 향상을 보였다.
  • 피크 가능성도 전략이 기대 관련성 전략과 매우 유사한 랭킹 점수를 생성하였으며, 계산 비용이 적어 효율적인 대안이 되었다.
  • 세분화된 레이블을 사용한 모델은 상위 점수를 받는 문서들 사이의 차이를 더 잘 구분하여, 이진 프롬프트에서 관찰된 '평탄한 효과'(plateau)를 피할 수 있었다.
  • 레이블 수가 많아질수록 성능이 항상 향상되진 않았으며, RG-S(0,8)와 RG-S(0,10)는 RG-S(0,4)보다 성능이 열 劣하므로 최적의 레이블 세분화 수준이 존재함을 시사했다.
  • 실제 레이블이 이진인 데이터셋에서도 성능 향상이 유지되었으며, 이는 향상 요인이 레이블 일치가 아니라 모델의 더 나은 추론 능력에 기인함을 시사한다.
  • 기대 관련성 방법은 대부분의 프롬프트 유형에서 피크 가능성도를 능가했지만, 텍스트 레이블 설정에서는 후자가 여전히 경쟁력 있는 성능을 보였다.
(b) Fine-grained relevance label generation
(b) Fine-grained relevance label generation

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.