[論文レビュー] Improving Passage Retrieval with Zero-Shot Question Generation
本論文では、事前学習言語モデルを用いて各パassageから入力クエリを生成する確率に基づいてパassageをスコア化することで、教師なしのリランキング手法であるUnsupervised Passage Re-ranking (UPR) を提案する。微調整やラベル付きデータを一切用いずに、非教師ありリtrieverを上回る6%-18%のトップ20リtrieval精度向上を達成し、オープンドメインQAベンチマークで新たなSOTA結果を達成した。
We propose a simple and effective re-ranking method for improving passage retrieval in open question answering. The re-ranker re-scores retrieved passages with a zero-shot question generation model, which uses a pre-trained language model to compute the probability of the input question conditioned on a retrieved passage. This approach can be applied on top of any retrieval method (e.g. neural or keyword-based), does not require any domain- or task-specific training (and therefore is expected to generalize better to data distribution shifts), and provides rich cross-attention between query and passage (i.e. it must explain every token in the question). When evaluated on a number of open-domain retrieval datasets, our re-ranker improves strong unsupervised retrieval models by 6%-18% absolute and strong supervised models by up to 12% in terms of top-20 passage retrieval accuracy. We also obtain new state-of-the-art results on full open-domain question answering by simply adding the new re-ranker to existing models with no further changes.
研究の動機と目的
- タスク固有のトレーニングデータや微調整を必要とせず、オープンドメインパassageリtrievalを改善すること。
- 事前学習言語モデルのみを用いて、クエリとパassageトークン間の深いクロスアテンションを可能にするリランカーを開発すること。
- 事前学習リーダーと再ランク済みパassageを用いた推論のみで、オープンドメイン質問応答でSOTA性能を達成すること。
- 教師なしパイプラインが、DPRのような強力な教師あり密度リtrievalモデルを上回ることを示すこと。
- 多様なリtriever、言語モデル、データセットに対して、ゼロショット再ランキングの一般化性と頑健性を調査すること。
提案手法
- リランカーは、関連性の代理として質問生成を用い、事前学習言語モデルを用いて条件付き確率 p(質問 | パassage) を計算する。
- このスコアリングを、リtrieバルタスク用の微調整やラベル付き例が一切不要なゼロショットの方法で適用する。
- スパース(例:BM25)および密度(例:DPR)リtrieverを含む、あらゆるリtrieバルシステムと互換性がある。
- クエリとパassageトークン間のクロスアテンションを活用し、質問のすべてのトークンに注意を払わせる。
- T0などのインstructチューニング済み言語モデルを用いて性能を向上させ、'以下のパassageをもとに、それが答えとなる質問を生成すること。' といったプロンプトを活用する。
- 再ランキングは、トップ-Kパassageをリtrieブした後、質問生成の尤度スコアに基づいて再順序付けを行う。
実験結果
リサーチクエスチョン
- RQ1タスク固有の微調整なしに、ゼロショット質問生成モデルが、リtrieブされたパassageを効果的に再ランクできるか?
- RQ2事前学習言語モデルを用いて質問尤度を計算することで、多様なデータセットやリtrieverでリtrieval精度が向上するか?
- RQ3教師なし再ランキング手法が、DPRのような教師あり密度リtrievalモデルを上回ることができるか?
- RQ4事前学習言語モデルの選択(例:インストラクションチューニング済み対非インストラクションチューニング済み)が、再ランキング性能に与える影響は?
- RQ5事前学習リーダーと組み合わせた場合、エンドツーエンドのオープンドメインQAにおいて、この再ランカーがどの程度性能向上をもたらすか?
主な発見
- Contriever(非教師ありリtriever)がリtrieブしたトップ1000パassageを再ランクする際、UPRはトップ20リtrieval精度を6%-18%絶対値で向上させた。
- SQuAD-OpenおよびEntity Questionsデータセットでは、UPRはそれぞれBM25をトップ20精度で14%および8%上回った。
- UPRは、パassageを再ランクし、事前学習リーダーを用いるだけで、オープンドメインQAで新たなSOTA結果を達成し、EMスコアを最大3ポイント向上させた。
- UPRは、DPRのような強力な教師ありリtrieverに対しても、トップ20リtrieval精度で最大12%の向上を達成した。
- インストラクションチューニング済みモデル(例:T0)が再ランカーとして最も優れた性能を示し、ゼロショット設定におけるプロンプト工学の重要性を示した。
- 性能向上は、スパースおよび密度リtrieverを問わず一貫しており、強力な一般化性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。