Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Down, LiTting Up: Efficient Zero-Shot Listwise Reranking with Seq2seq Encoder-Decoder Models

Manveer Singh Tamber, R. Pradeep|arXiv (Cornell University)|2023. 12. 26.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 T5 인코더-디코더 아키텍처 기반의 효율적인 제로샷 리스트와이즈 재정렬 모델인 LiT5-Distill과 LiT5-Score를 소개한다. 이 모델들은 단지 220M에서 3B 파라미터를 사용하면서도 대규모 LLM과 유사한 최신 기술 성능을 달성한다. RankGPT 모델들로부터의 정렬을 희석시키고, 관련성 스코어 산정을 위해 크로스 어텐션 스코어를 활용함으로써, 레이블이 부여된 관련성 데이터에 의존하지 않으면서도 MS MARCO 및 BEIR 벤치마크에서 뛰어난 효과를 발휘한다.

ABSTRACT

Recent work in zero-shot listwise reranking using LLMs has achieved state-of-the-art results. However, these methods are not without drawbacks. The proposed methods rely on large LLMs with billions of parameters and limited context sizes. This paper introduces LiT5-Distill and LiT5-Score, two methods for efficient zero-shot listwise reranking, leveraging T5 sequence-to-sequence encoder-decoder models. Our approaches demonstrate competitive reranking effectiveness compared to recent state-of-the-art LLM rerankers with substantially smaller models. Through LiT5-Score, we also explore the use of cross-attention to calculate relevance scores to perform reranking, eliminating the reliance on external passage relevance labels for training. We present a range of models from 220M parameters to 3B parameters, all with strong reranking results, challenging the necessity of large-scale models for effective zero-shot reranking and opening avenues for more efficient listwise reranking solutions. We provide code and scripts to reproduce our results at https://github.com/castorini/LiT5.

연구 동기 및 목표

  • 대규모 LLM의 성능을 빠르게 구현하면서도 파라미터 수가 많지 않은 소규모 리스트와이즈 재정렬 모델을 개발하는 것.
  • RankGPT 3.5 및 4와 같은 대규모 LLM들로부터의 정렬 행동을 더 작은 T5 기반 모델로 희석시키는 방법을 탐색하는 것.
  • 외부 파assage 관련성 레이블에 의존하지 않도록 하기 위해 크로스 어텐션 스코어를 내재된 관련성 신호로 활용하는 것.
  • 다양한 벤치마크에서 제로샷 재정렬 설정에서 소형 모델(220M–3B 파라미터)의 효과성을 평가하는 것.
  • 인코더-디코더 모델의 크기 증가가 리스트와이즈 재정렬 성능에 미치는 영향를 조사하고, 더 큰 버전에서 과적합 위험을 평가하는 것.

제안 방법

  • LiT5-Distill은 대규모 LLM(RankGPT 3.5/4)에서 유도된 정렬 행동을 더 작은 T5 기반 인코더-디코더 모델로 희석시키는 지식 희석 기법을 사용한다.
  • 이 방법은 지도된 지침 데이터를 활용해 학생 모델이 교사 모델과 동일한 순서의 정렬을 예측하도록 피지컬 트레이닝을 수행한다.
  • LiT5-Score는 FiD 스타일 디코더의 크로스 어텐션 스코어를 활용해 레이블이 없는 관련성 데이터 없이도 파assage 관련성을 계산한다.
  • 두 모델 모두 입력으로 쿼리와 파assage 목록을, 출력으로 재정렬된 목록을 내보내는 시퀀스 투 시퀀스 프레임워크를 사용한다.
  • 모델들은 대규모 LLM에서 생성된 합성 데이터로 훈련되고, MS MARCO 및 BEIR와 같은 표준 벤치마크에서 평가된다.
  • 훈련 과정은 두 단계의 피지컬 트레이닝으로 구성되며, 먼저 전체 파assage 목록으로, 그 다음로 무작위로 추출된 파assage 서브셋으로 훈련하여 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1시퀀스 투 시퀀스 인코더-디코더 모델이 제로샷 리스트와이즈 재정렬에 효과적으로 적용될 수 있는가?
  • RQ2대규모 LLM의 재정렬 성능이 더 작은 T5 기반 모델로 성공적으로 희석될 수 있는가?
  • RQ3FiD 스타일 모델의 크로스 어텐션 스코어가 레이블이 없는 파assage 관련성 측정 기준으로 신뢰할 수 있는 신호가 될 수 있는가?
  • RQ4모델 크기가 제로샷 설정에서 재정렬 성능에 어떤 영향을 미치는가?
  • RQ5제한된 데이터로 훈련할 경우 더 큰 모델에서 과적합 현상이 발생하는가? 그리고 이를 어떻게 완화할 수 있는가?

주요 결과

  • 3B 파라미터를 가진 LiT5-Distill XL은 더 작은 파라미터를 가진 상태에서 MS MARCO 컬렉션 여러 개에서 RankGPT 4 및 RankZephyr보다 뛰어난 성능을 보였다.
  • 220M 파라미터를 가진 LiT5-Distill 베이스 모델은 DL19에서 nDCG@10 스코어 0.689, DL20에서 0.662를 기록하여 매우 적은 파라미터로도 뛰어난 성능을 보였다.
  • 3B 파라미터를 가진 LiT5-Score XL은 BEIR 컬렉션에서는 더 큰 변형보다 뛰어난 성능을 보였지만, 1 에포크 이상 훈련한 경우 MS MARCO에서 성능이 열 劣화되었다.
  • LiT5-Score 베이스 및 라지 모델은 각각 DL19에서 nDCG@10 0.689 및 0.720의 스코어를 기록했으며, 2 에포크의 훈련으로 강력한 일반화 능력을 보였다.
  • LiT5-Score XL은 1 에포크 이상 훈련한 경우 DL19 및 DL20에서 성능 저하가 관찰되어 과적합 현상이 발생한 것으로 확인되었다.
  • FiD 스타일 디코더의 크로스 어텐션 스코어는 강력한, 레이블이 없는 관련성 신호를 제공하여 외부 감독 없이도 효과적인 제로샷 재정렬을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.