Skip to main content
QUICK REVIEW

[論文レビュー] RankT5: Fine-Tuning T5 for Text Ranking with Ranking Losses

Honglei Zhuang, Zhen Qin|arXiv (Cornell University)|Oct 12, 2022
Topic Modeling被引用数 5
ひとこと要約

この論文では、エンコーダー・デコーダー構造およびエンコーダー・オンリー構造を直接順位スコア(数値)を出力できるように変更することで、T5をテキスト順位付けに微調整する方法であるRankT5を提案する。分類損失の代わりにペairワイズおよびリストワイズ順位付け損失を用いて学習することで、MS MARCOおよびNatural Questionで顕著な性能向上を達成し、リストワイズ損失はドメイン外データへのゼロショット一般化性能を向上させる。

ABSTRACT

Recently, substantial progress has been made in text ranking based on pretrained language models such as BERT. However, there are limited studies on how to leverage more powerful sequence-to-sequence models such as T5. Existing attempts usually formulate text ranking as classification and rely on postprocessing to obtain a ranked list. In this paper, we propose RankT5 and study two T5-based ranking model structures, an encoder-decoder and an encoder-only one, so that they not only can directly output ranking scores for each query-document pair, but also can be fine-tuned with "pairwise" or "listwise" ranking losses to optimize ranking performances. Our experiments show that the proposed models with ranking losses can achieve substantial ranking performance gains on different public text ranking data sets. Moreover, when fine-tuned with listwise ranking losses, the ranking model appears to have better zero-shot ranking performance on out-of-domain data sets compared to the model fine-tuned with classification losses.

研究の動機と目的

  • T5のような強力なシーケンス・トゥ・シーケンスモデルをテキスト順位付けに活用する際のギャップを埋める。従来、分類またはトークン生成に依存している。
  • T5が離散的トークンではなく連続的順位スコアを直接出力できるようにし、順位付けに特化した目的関数によるエンド・ツー・エンド最適化を可能にする。
  • 分類ベースの微調整と比較して、順位付け損失(ペアワイズ/リストワイズ)を用いた微調整が、ドメイン内およびゼロショットドメイン外性能を向上させるかどうかを検証する。
  • Softmaxなどのリストワイズ損失を用いる場合、訓練用リストのサイズがモデル性能に与える影響を調査する。
  • 多様なドメイン外ベンチマークにおいて、順位付け損失で微調整されたモデルとポイントワイズ分類損失で微調整されたモデルの一般化能力を比較する。

提案手法

  • エンコーダー・デコーダー構造(スコアトークンを生成)とエンコーダー・オンリー構造(ヘッド層を介して連続的順位スコアに回帰)の2つのRankT5モデルバリアントを提案する。
  • 標準的な交差エントロピー損失の代わりに、ポイントワイズ(PointCE)、Softmax(リストワイズ)、ペアワイズ損失などの順位付け損失を用いてモデルを微調整する。
  • 1つの正例と複数の負例を含む、クエリ・ドキュメントペアのリストとして訓練データを構造化し、リストサイズを5から36まで変化させてその影響を調査する。
  • 推論にはエンコーダー・オンリーバリアントを用い、[CLS]トークンの表現を連続的順位スコアにマップする回帰ヘッドを適用する。
  • ゼロショット評価において、BM25で取得した上位1000件のドキュメントを再順位付けするために、微調整済みモデルを多様なBEIRベンチマークデータセットに適用する。
  • 標準的なT5微調整手順を採用するが、NDCGなどの順位付け指標を最大化するように損失関数を設計する。

実験結果

リサーチクエスチョン

  • RQ1T5が離散的トークンではなく連続的順位スコアを出力できるようにすることで、テキスト順位付けに効果的に適応できるか?
  • RQ2Softmaxなどのリストワイズ順位付け損失でT5を微調整することで、ポイントワイズ分類損失と比較してドメイン内およびゼロショット性能が向上するか?
  • RQ3リストワイズ損失を用いる場合、訓練用リストのサイズ(1クエリあたりのドキュメント数)がモデル性能に与える影響は?
  • RQ4順位付け損失で微調整されたモデルは、分類損失で微調整されたモデルと比較して、ドメイン外データへの一般化能力が優れているか?
  • RQ5低データまたはゼロショット条件下で、エンコーダー・デコーダー構造とエンコーダー・オンリー構造のRankT5アーキテクチャ間に性能差があるか?

主な発見

  • 特にSoftmax損失を用いた微調整により、RankT5モデルはMS MARCOおよびNatural Questionデータセットで分類ベースの微調整を著しく上回る性能を達成した。
  • 15のBEIRドメイン外データセットにおいて、Softmax損失はPointCE損失よりも平均で+2.1% NDCG@10を向上させ、統計的に有意な改善(p ≤ 0.05)を示した。
  • 医療分野のデータセット(TREC-COVID、BioASQ、NFCorpus)では、Softmax損失がPointCE損失よりも平均で+4.6%の向上を示し、より優れたドメイン一般化能力を示した。
  • モデル性能は訓練用リストサイズが大きくなるにつれて向上し、NQでは30以上のリストサイズで飽和が観察された。MS MARCOでは36まで一貫した向上トレンドが見られた。
  • 回帰ヘッドを備えたエンコーダー・オンリーRankT5バリアントは高い性能を発揮し、効率的な推論を可能にし、初期順位付け段階に適している。
  • リストワイズ損失で微調整することで、モデルは関連性の抽象的概念をよりよく捉え、コーパス固有の記憶依存性を低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。