Skip to main content
QUICK REVIEW

[論文レビュー] On the Robustness of Generative Retrieval Models: An Out-of-Distribution Perspective

Yuan Liu, Ruqing Zhang|arXiv (Cornell University)|Jun 22, 2023
Information Retrieval and Search Behavior被引用数 6
ひとこと要約

本稿は、生成的リtrievalモデルの分布外(OOD)耐性を、3つのOODシナリオ(クエリの変種、予期しないクエリタイプ、予期しないタスク)を定義することで調査する。KILTベンチマークを用いて、BART や CorpusBrain といった生成的リtrievalモデルが、特にクエリの変種および予期しないクエリタイプにおいて顕著な性能低下を示すことが明らかになった。これは、通常の分布内評価を超えて、実世界での導入に向けた耐性の向上が急務であることを示唆している。

ABSTRACT

Recently, we have witnessed generative retrieval increasingly gaining attention in the information retrieval (IR) field, which retrieves documents by directly generating their identifiers. So far, much effort has been devoted to developing effective generative retrieval models. There has been less attention paid to the robustness perspective. When a new retrieval paradigm enters into the real-world application, it is also critical to measure the out-of-distribution (OOD) generalization, i.e., how would generative retrieval models generalize to new distributions. To answer this question, firstly, we define OOD robustness from three perspectives in retrieval problems: 1) The query variations; 2) The unforeseen query types; and 3) The unforeseen tasks. Based on this taxonomy, we conduct empirical studies to analyze the OOD robustness of several representative generative retrieval models against dense retrieval models. The empirical results indicate that the OOD robustness of generative retrieval models requires enhancement. We hope studying the OOD robustness of generative retrieval models would be advantageous to the IR community.

研究の動機と目的

  • 生成的リtrievalモデルにおける分布外(OOD)耐性の体系的評価が不足している現状に鑲って、通常は分布内仮定のもとでの評価にとどまっていることに対処すること。
  • リtrieバルシステムにおける主要なOOD一般化課題を特定・分類すること、特にトレーニング時とは異なるテストデータ分布が想定される実世界の展開において重要である。
  • 多様なOODシナリオにおいて、生成的リtrievalモデル(例:BART、CorpusBrain)と密度的リtrieバルベースライン(例:DPR)のOOD一般化性能を実証的に比較すること。
  • 現在の生成的リtrievalモデルが分布シフト、特にクエリ品質およびフォーマットの変化に対してどのように耐性を欠いているかを強調し、今後の耐性指向研究の動機づけを行うこと。
  • OOD耐性に関するさらなる研究を支援するため、コードとデータを公開すること。

提案手法

  • リtrieバルにおけるOOD耐性の3段階分類法を提唱する:(1) クエリの変種(例:スペルミス、語順の入れ替え)、(2) 予期しないクエリタイプ(例:ウェブ検索クエリ vs. 知識ベースクエリ)、(3) 予期しない下流タスク(例:エンティティリンキング、スロットフィリング)。
  • KILTベンチマーク(例:NQ、EL、SFを含む5つのタスクにまたがる11のデータセット)を用いて、これらのOOD状況下でのモデル性能を評価する。
  • 標準的なリtrieバルメトリクス(例:R-precision、DR_OOD(OOD低下率))を用いて、生成的リtrievalモデル(BART、CorpusBrain)と密度的リtrieバルベースライン(例:DPR)の両方を評価する。
  • タスク固有のリtrieバル目的に基づいて微調整された事前学習モデルを適用し、CorpusBrainは一般化を向上させるために3つの特化型事前学習タスク(ISS、LPS、HIP)を用いる。
  • トレーニング中に見られなかったドメイン外のクエリタイプやタスク、またはクエリの摂動(例:スペルミス、再順序化)を用いて、制御されたOODテスト分割を設計する。
  • DR_OOD(分布内から分布外への性能低下)を用いて性能低下を測定し、耐性を定量化する。

実験結果

リサーチクエスチョン

  • RQ1スペルミスや語順の変更といったクエリの変種に対して、生成的リtrievalモデルは分布内性能と比べてどの程度の性能を示すか?
  • RQ2トレーニング中に見られなかった予期しないクエリタイプ(例:ウェブ検索クエリ)に対して、生成的リtrievalモデルはどの程度一般化できるか?
  • RQ3事前学習目的とは異なる予期しない下流タスク(例:エンティティリンキング)において、生成的リtrievalモデルはどの程度の性能を示すか?
  • RQ4生成モデルの事前学習設計(例:CorpusBrain 対 BART)が、さまざまな耐性シナリオにおけるOOD一般化に与える影響は何か?
  • RQ5密度的リtrieバルモデルは、OOD一般化において生成モデルをどの程度上回るのか?また、分布シフト下での生成モデルの主な失敗モードは何か?

主な発見

  • 生成的リtrievalモデルはOOD状況下で顕著な性能低下を示し、スペルミスや語順変更といったクエリ変種タスクでは平均R-precisionが20%以上低下している。
  • NQデータセットでは、BART などの生成モデルが、ウェブ検索クエリなど予期しないクエリタイプに対して特に耐性が低く、一部のケースでDR_OOD値が30%を超えることが判明した。
  • CorpusBrain はすべてのOODシナリオでBARTを上回り、20の予期しないタスク組み合わせのうち13でより優れた一般化性能を示しており、タスク固有の事前学習の利点を実証した。
  • 生成的モデルのOOD低下率(DR_OOD)は、特にクエリ変種および予期しないクエリタイプの状況下で、密度的リtrieバルモデルよりも一貫して高い。
  • 生成的モデル内でも、事前学習設計の違いが重要であることが判明した:CorpusBrainの3段階事前学習(ISS、LPS、HIP)は、標準的なBARTに比べて分布シフトに対する耐性を顕著に向上させた。
  • 本研究は、現在の生成的リtrievalモデルが実世界の分布シフトに対して耐性を欠いていることを明らかにした。これは、強力な分布内性能を示す一方で、一般化能力に深刻なギャップが存在することを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。