Skip to main content
QUICK REVIEW

[論文レビュー] Generator-Retriever-Generator Approach for Open-Domain Question Answering

Abdelrahman Abdallah, Adam Jatowt|arXiv (Cornell University)|Jul 21, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、質問から文脈的に関連する文書を大規模言語モデル(LLM)が生成すると同時に、密なベクトル検索器を用いて外部文書を取得する、新しいオープンドメイン質問応答フレームワークであるGenerator-Retriever-Generator(GRG)を提案する。2番目のLLMが生成された文書と取得された文書を統合して最終的な回答を生成し、TriviaQA、Natural Questions(NQ)、WebQの各ベンチマークで最先端の性能を達成し、F1スコアで最大+5.2ポイントの向上を示した。

ABSTRACT

Open-domain question answering (QA) tasks usually require the retrieval of relevant information from a large corpus to generate accurate answers. We propose a novel approach called Generator-Retriever-Generator (GRG) that combines document retrieval techniques with a large language model (LLM), by first prompting the model to generate contextual documents based on a given question. In parallel, a dual-encoder network retrieves documents that are relevant to the question from an external corpus. The generated and retrieved documents are then passed to the second LLM, which generates the final answer. By combining document retrieval and LLM generation, our approach addresses the challenges of open-domain QA, such as generating informative and contextually relevant answers. GRG outperforms the state-of-the-art generate-then-read and retrieve-then-read pipelines (GENREAD and RFiD) improving their performance by at least by +5.2, +4.2, and +1.6 on TriviaQA, NQ, and WebQ datasets, respectively. We provide code, datasets, and checkpoints at https://github.com/abdoelsayed2016/GRG.

研究の動機と目的

  • 既存のオープンドメインQAパイプラインの限界、例えばノイズの多い文書チャンクや質問と文書の間の浅い相互作用を解消すること。
  • LLMが生成する文脈と密なパラグラフ検索を統合することで、回答の関連性と情報量を向上させること。
  • 固定された、しばしば関連のない文書チャンクに依存するのを減らし、文脈に適合した文書を生成することで、文書の適合性を高めること。
  • 生成された文書と取得された文書を統合的に処理することで、質問と文書の複雑な依存関係を捉えるモデルの能力を強化すること。
  • 今後の研究のための再現可能でオープンソースのソリューション(コード、データセット、モデルチェックポイントを含む)を提供すること。

提案手法

  • GRGフレームワークは二段階のプロセスを採用する。まず、指示微調整済みLLM(例:InstructGPT)が入力された質問に基づいて合成的で文脈豊かな文書を生成する。
  • 同時に、デュアルエンコーダー型の密なパラグラフ検索器(例:DPRベース)が、意味的類似度を用いて外部コーパスから関連する文書を取得する。
  • 生成された文書と取得された文書を連結し、2番目のLLMに供給することで、統一的な推論プロセスを通じて最終的な回答が生成される。
  • ベクトルインデックス検索器は、知識カバレッジと回答の尤もらしさを向上させるために、効率的でベクトルベースの検索メカニズムとして導入された。
  • 特に曖昧な質問や複数事実を含む質問の処理に注力し、回答の質と多様性のバランスを最適化するように、エンドツーエンドで訓練される。
  • TrivivaQA、NQ、WebQで評価され、各コンponentの貢献度を分析するためのアブレーションスタディが実施された。
Figure 1: Simplified diagram illustrating the idea behind the Generator-Retriever-Generator approach.
Figure 1: Simplified diagram illustrating the idea behind the Generator-Retriever-Generator approach.

実験結果

リサーチクエスチョン

  • RQ1LLMが生成する文脈と外部文書検索を組み合わせることで、オープンドメインQAにおける回答の正確性が向上するか?
  • RQ2生成された文書と取得された文書の相互作用は、回答の関連性と情報量にどのように影響するか?
  • RQ3F1スコアと正確一致スコアの観点から、GRGフレームワークは、従来の「生成→読解」および「検索→読解」パイプラインを上回るか?
  • RQ4文書生成の質と検索精度が、最終的な回答生成に与える影響は何か?
  • RQ5GRGは、ベースラインモデルと比較して、曖昧な質問や複数事実を含む質問をどれほど効果的に処理できるか?

主な発見

  • GRGはTriviaQAで最先端の性能を達成し、最良のベースライン(RFiD)を+5.2ポイント以上上回るF1スコアを達成した。
  • Natural Questions(NQ)データセットでは、最も強力な先行手法と比較してF1スコアが+4.2ポイント向上した。
  • WebQでは、現在のSOTAを+1.6 F1ポイント上回り、多様なベンチマークで一貫した向上を示した。
  • モデルは曖昧な質問に対して複数の正しい回答を生成し、例えばマイケル・ジャクソンの自伝について「Moonwalk」と「Moonwalk (disambiguation)」を特定することで、知識カバレッジの向上を反映した。
  • アブレーションスタディにより、文書生成と検索の両方が性能向上に顕著に寄与しており、併用することで最良の結果が得られることを確認した。
  • フレームワークは繊細な質問に対しても頑健であることが示され、ジャミー・リー・カーティスの星座を正しく「スコーピオン」に特定し、ゴールドスタンダードと一致した。
Figure 2: Architecture diagram illustrating the Generator-Retriever-Generator (GRG) approach, which combines document retrieval techniques and large language models to generate contextual documents and retrieve relevant information for answering questions.
Figure 2: Architecture diagram illustrating the Generator-Retriever-Generator (GRG) approach, which combines document retrieval techniques and large language models to generate contextual documents and retrieve relevant information for answering questions.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。