Skip to main content
QUICK REVIEW

[論文レビュー] Answering Complex Open-domain Questions Through Iterative Query Generation

Peng Qi, Xiaowen Lin|arXiv (Cornell University)|Oct 15, 2019
Topic Modeling参考文献 26被引用数 13
ひとこと要約

GoldEn Retriever は、オープンドメインのマルチホップQAのための反復的で自然言語クエリ生成フレームワークを提案する。外部の既存IRシステムを用いて段階的に支援証拠を取得する。BERT風の事前学習言語モデルに依存せず、人間のクエリに類似した反復的証拠収集により、高い効率性と解釈可能性を実現し、HotpotQAのfullwiki設定で最先端の性能を達成した。

ABSTRACT

It is challenging for current one-step retrieve-and-read question answering (QA) systems to answer questions like "Which novel by the author of 'Armada' will be adapted as a feature film by Steven Spielberg?" because the question seldom contains retrievable clues about the missing entity (here, the author). Answering such a question requires multi-hop reasoning where one must gather information about the missing entity (or facts) to proceed with further reasoning. We present GoldEn (Gold Entity) Retriever, which iterates between reading context and retrieving more supporting documents to answer open-domain multi-hop questions. Instead of using opaque and computationally expensive neural retrieval models, GoldEn Retriever generates natural language search queries given the question and available context, and leverages off-the-shelf information retrieval systems to query for missing entities. This allows GoldEn Retriever to scale up efficiently for open-domain multi-hop reasoning while maintaining interpretability. We evaluate GoldEn Retriever on the recently proposed open-domain multi-hop QA dataset, HotpotQA, and demonstrate that it outperforms the best previously published model despite not using pretrained language models such as BERT.

研究の動機と目的

  • 複雑なオープンドメイン質問に応じたマルチホップ推論を実現するが、キーエンティティが元の質問から直接取得できないという課題に対処すること。
  • 高価なニューラルリtrievalモデルに依存しないスケーラブルで解釈可能なマルチホップQA手法の開発。
  • 最小限の監視信号によるクエリ生成を通じて、ゴール支援文書のリtrieval再現率を向上させること。
  • エンドツーエンドのニューラルモデルではなく、汎用的なIRシステムを用いた効率的で反復的な証拠収集を可能とすること。

提案手法

  • GoldEn Retriever は、元の質問と前段階で取得したコンテキストに基づいて自然言語クエリを反復的に生成し、新たな支援文書を取得する。
  • 生成されたクエリを用いて、標準的な情報検索システム(例:BM25を用いたElasticsearch)が文書検索を実行する。
  • 各検索ステップ後に、BiDAF++スタイルの読解モジュールを用いて取得した証拠から答えを抽出する。
  • クエリ生成は、ゴール支援文書の検索再現率を最大化するように最小限の監視信号で訓練される。
  • スケーラビリティとオープンドメイン推論における解釈可能性を確保するため、外部の既存IRコンponentを統合する。
  • Elasticsearch はタイトルフィールドと本文フィールドを設定し、ビグラムシングリングとASCIIフォールディングを用いて、希少エンティティのマッチング精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1反復的自然言語クエリ生成は、複雑なオープンドメイン質問の支援証拠の検索を改善できるか?
  • RQ2BERTのような大規模事前学習言語モデルを用いずに、強力なマルチホップQA性能を達成できるか?
  • RQ3生成クエリを用いた外部の既存IRシステムは、解釈可能性を保ちつつ効率的にスケーリングできるか?
  • RQ4最小限の監視によるクエリ生成は、ゴール支援文書の再現率向上にどの程度効果的か?

主な発見

  • GoldEn Retriever は、BERT や類似する事前学習言語モデルを用いない状態で、HotpotQA のオープンドメイン(fullwiki)設定において、以前に発表された最良のモデルを上回った。
  • システムは、外部の既存IRシステムを用いて、反復的に自然言語クエリを生成することで、欠落したエンティティを取得し、最先端の性能を達成した。
  • 反復的クエリ生成の導入により、最小限の監視でもゴール支援文書のリtrieval再現率が顕著に向上した。
  • フレームワークは各ステップで人間が読みやすいクエリを生成するため、不透明なニューラルリtrievalモデルとは異なり、高い解釈可能性を維持している。
  • BM25とタイトルブースティングを用いたElasticsearchは、たとえば「Ernest Cline」のような希少エンティティの検索精度を向上させ、通常のフルテキスト検索では見過ごされがちなエンティティの検出を改善した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。