Skip to main content
QUICK REVIEW

[論文レビュー] Multiview Identifiers Enhanced Generative Retrieval

Yongqi Li, Nan Yang|arXiv (Cornell University)|May 26, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、MINDERを提案する。MINDERは、複数の視点からの識別子を統合した生成的リtrievalフレームワークであり、パassageの内容から合成された識別子(具体的には疑似クエリ)を生成することで、リtrievalの効果性を向上させる。タイトル、部分文字列、およびコンテンツに基づく疑似クエリという補完的な視点を同時に活用することで、MINDERは3つの公開データセットにおいて最先端の性能を達成し、多様なクエリタイプにわたる優れたロバスト性とカバレッジを示している。

ABSTRACT

Instead of simply matching a query to pre-existing passages, generative retrieval generates identifier strings of passages as the retrieval target. At a cost, the identifier must be distinctive enough to represent a passage. Current approaches use either a numeric ID or a text piece (such as a title or substrings) as the identifier. However, these identifiers cannot cover a passage's content well. As such, we are motivated to propose a new type of identifier, synthetic identifiers, that are generated based on the content of a passage and could integrate contextualized information that text pieces lack. Furthermore, we simultaneously consider multiview identifiers, including synthetic identifiers, titles, and substrings. These views of identifiers complement each other and facilitate the holistic ranking of passages from multiple perspectives. We conduct a series of experiments on three public datasets, and the results indicate that our proposed approach performs the best in generative retrieval, demonstrating its effectiveness and robustness.

研究の動機と目的

  • 従来の生成的リtrieバル手法がタイトルや数値IDといった静的識別子に依存するという制限を是正すること。これらの識別子は文脈的な豊かさに欠け、包括的なカバレッジも得にくい。
  • パassageの内容から導出される合成識別子、特に複数文の意味を捉える疑似クエリを導入することで、リtrieバル性能を向上させること。
  • クエリタイプに応じて適した視点(タイトル、部分文字列、疑似クエリ)を同時に考慮することで、包括的なパassageランク付けを実現すること。
  • 複数視点からの識別子統合が、多様なリtrieバルシナリオにおいてモデルのロバスト性と効果性を向上させることを実証すること。

提案手法

  • MINDERは、クエリと識別子タイプ(例:'title'、'substring'、'pseudo-query')を条件として、自己回帰的言語モデルを用いて識別子を生成する。
  • 合成識別子は、パassageのセグメントを質問形式に再表現することで生成され、文脈的に豊かな複数文の識別子として機能する。
  • モデルはビームサーチを用いて各視点ごとに複数の候補識別子を生成し、その後ヒューリスティック関数を用いてそれらを統合して候補パassageのランク付けを行う。
  • パassageは、すべての3つの識別子視点におけるカバレッジに基づいてランク付けされるため、異なる視点からの補完的スコアリングが可能になる。
  • 識別子の効率的かつ線形な空間計算量(識別子サイズに比例)を確保するため、FMインデックスというデータ構造を用いる。

実験結果

リサーチクエスチョン

  • RQ1パassageの内容から導出される合成識別子(例:疑似クエリ)は、タイトルや部分文字列といった静的識別子を上回る生成的リtrieバル性能を実現できるか?
  • RQ2タイトル、部分文字列、疑似クエリという複数の視点からの識別子を統合することで、単一視点アプローチに比べてリtrieバル性能がどのように向上するか?
  • RQ3多様なクエリタイプ(一般、詳細、複雑なクエリ)にわたって、複数視点識別子はどの程度ロバスト性を向上させるか?
  • RQ4疑似クエリを合成識別子として組み込むことで、リtrieバルのカバレッジと正確性はどのように変化するか?

主な発見

  • MINDERは、MSMARCO、NQ、TriviaQAという3つの公開データセットにおいて、既存の生成的リtrieバル手法を上回る最先端の性能を達成した。
  • 疑似クエリを合成識別子として組み込むことで、特に複数文の理解を要する複雑なクエリに対して、リtrieバルのカバレッジが顕著に向上した。
  • NQおよびTriviaQAではビームサイズ15〜20が最適な性能を示したが、MSMARCOではパassageの冗長性が高いため、より小さいビームサイズ(例:5)が好ましい。
  • MSMARCOでは部分文字列視点の寄与度が低く、部分文字列の特徴が明確でないためである。一方、タイトル視点と疑似クエリ視点は、全データセットでより強い性能を示した。
  • MINDERは、多視点生成処理のため、SEALに比べて1.2倍の推論時間を要するが、その分リtrieバルの正確性が向上しており、このコストは相殺される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。