Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Down, LiTting Up: Efficient Zero-Shot Listwise Reranking with Seq2seq Encoder-Decoder Models

Manveer Singh Tamber, R. Pradeep|arXiv (Cornell University)|Dec 26, 2023
Music and Audio Processing被引用数 4
ひとこと要約

この論文は、T5エンコーダデコーダアーキテクチャに基づく、効率的なゼロショットリストワイズ再ランク化モデルであるLiT5-DistillとLiT5-Scoreを紹介している。220M~3Bパラメータという限定的なパラメータ数で、大規模言語モデル(LLM)と同等の最先端のパフォーマンスを達成している。RankGPTモデルからの順序付けの知識蒸留と、関連性スコア算出にクロスアテンションスコアを活用することで、外部の関連性ラベルに依存せず、MS MARCOおよびBEIRベンチマークでも高い有効性を維持している。

ABSTRACT

Recent work in zero-shot listwise reranking using LLMs has achieved state-of-the-art results. However, these methods are not without drawbacks. The proposed methods rely on large LLMs with billions of parameters and limited context sizes. This paper introduces LiT5-Distill and LiT5-Score, two methods for efficient zero-shot listwise reranking, leveraging T5 sequence-to-sequence encoder-decoder models. Our approaches demonstrate competitive reranking effectiveness compared to recent state-of-the-art LLM rerankers with substantially smaller models. Through LiT5-Score, we also explore the use of cross-attention to calculate relevance scores to perform reranking, eliminating the reliance on external passage relevance labels for training. We present a range of models from 220M parameters to 3B parameters, all with strong reranking results, challenging the necessity of large-scale models for effective zero-shot reranking and opening avenues for more efficient listwise reranking solutions. We provide code and scripts to reproduce our results at https://github.com/castorini/LiT5.

研究の動機と目的

  • 大規模言語モデル(LLM)の性能に匹敵するが、膨大なパラメータ数を必要としない、小規模なリストワイズ再ランカーの開発。
  • RankGPT 3.5 や 4 といった大規模言語モデルから、より小さなT5ベースのモデルへの順序付け行動の知識蒸留の探求。
  • 外部のパラグラフ関連性ラベルに依存しないようにし、クロスアテンションスコアを内在的関連性信号として用いることによる依存性の排除。
  • 220M~3Bパラメータの小規模モデルが、多様なベンチマークでゼロショット再ランク化において有効であるかの評価。
  • エンコーダデコーダモデルのスケーリング行動と、大規模バージョンにおける過学習リスクの評価。

提案手法

  • LiT5-Distillは、大規模言語モデル(RankGPT 3.5/4)から順序付け行動を知識蒸留することで、より小さなT5ベースのエンコーダデコーダモデルに転送する。
  • 教師モデルの順序付けを再現するように、インstructチューニングデータを用いて学生モデルを微調整する。
  • LiT5-Scoreは、FiDスタイルのデコーダからのクロスアテンションスコアを活用し、関連性ラベルを必要とせずにパラグラフ関連性を算出する。
  • 両モデルとも、クエリとパラグラフのリストを入力とし、再ランクされたリストを出力するシーケンス・トゥ・シーケンスフレームワークを採用する。
  • 合成データを大規模言語モデルから生成し、MS MARCO や BEIR といった標準ベンチマークで評価する。
  • 2段階の微調整を実施:まず全パラグラフリストで微調整し、その後ランダムに抽出されたパラグラフサブセットで微調整することで汎化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1シーケンス・トゥ・シーケンスのエンコーダデコーダモデルは、ゼロショットリストワイズ再ランク化に効果的に適応可能か?
  • RQ2大規模言語モデルの再ランク化効果を、より小さなT5ベースのモデルに成功裏に蒸留できるか?
  • RQ3FiDスタイルのモデルからのクロスアテンションスコアは、関連性ラベルなしで信頼性の高いパラグラフ関連性測定に適しているか?
  • RQ4モデルサイズがゼロショット設定における再ランク化効果に与える影響は何か?
  • RQ5限られたデータで学習する際、大規模モデルに過学習が生じるか、そしてその対策は何か?

主な発見

  • 3BパラメータのLiT5-Distill XLは、パラメータ数が少ないにもかかわらず、RankGPT 4 や RankZephyr よりもMS MARCOの複数のコレクションで優れた性能を示した。
  • 220MパラメータのLiT5-Distillベースモデルは、DL19でnDCG@10が0.689、DL20で0.662を達成し、最小限のパラメータ数で強力な性能を示した。
  • 3BパラメータのLiT5-Score XLは、BEIRコレクションではより優れた有効性を示したが、1エポックを超えて学習した場合、MS MARCOでは性能が劣化した。
  • LiT5-Scoreベースおよびラージモデルは、それぞれDL19でnDCG@10が0.689および0.720を達成し、2エポックの学習で強力な汎化性能を示した。
  • LiT5-Score XLは、1エポックを超えて学習した場合、DL19およびDL20で性能低下が見られ、過学習の兆候が確認された。
  • FiDスタイルのデコーダにおけるクロスアテンションスコアは、関連性ラベルなしで強力な信号を提供し、外部の監視なしに効果的なゼロショット再ランク化を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。