Skip to main content
QUICK REVIEW

[論文レビュー] Multi-hop Reading Comprehension through Question Decomposition and Rescoring

Sewon Min, Victor W. Zhong|arXiv (Cornell University)|Jun 7, 2019
Topic Modeling参考文献 24被引用数 14
ひとこと要約

この論文では、複雑な質問をスパン予測を用いて単純な1ホップの部分質問に分解する手法 DecompRCを提案する。わずか400例のラベル付き例題で学習可能であり、HotpotQAで最先端の性能を達成する。部分質問生成とグローバルな再スコアリング機構を組み合わせることで、複数の分解経路から最良の最終的回答を選択し、説明可能で根拠に基づいた推論を実現する。

ABSTRACT

Multi-hop Reading Comprehension (RC) requires reasoning and aggregation across several paragraphs. We propose a system for multi-hop RC that decomposes a compositional question into simpler sub-questions that can be answered by off-the-shelf single-hop RC models. Since annotations for such decomposition are expensive, we recast sub-question generation as a span prediction problem and show that our method, trained using only 400 labeled examples, generates sub-questions that are as effective as human-authored sub-questions. We also introduce a new global rescoring approach that considers each decomposition (i.e. the sub-questions and their answers) to select the best final answer, greatly improving overall performance. Our experiments on HotpotQA show that this approach achieves the state-of-the-art results, while providing explainable evidence for its decision making in the form of sub-questions.

研究の動機と目的

  • 複数の段落に散らばった根拠を扱うマルチホップ読解の課題に対処するため、段階的推論を可能にする分解手法を提供すること。
  • 高価な人手による分解ラベルに依存しないようにするため、部分質問生成をスパン予測タスクとして定式化し、わずか400例のラベル付き例題で学習可能にする。
  • 全コンテキストを用いた複数の分解経路の評価を通じて、モデルの頑健性と性能を向上させるグローバルな再スコアリング機構を導入すること。
  • 最終回答の根拠となる人間が理解可能な部分質問を生成することで、説明可能なAI出力を提供すること。

提案手法

  • 部分質問生成をスパン予測タスクとしてモデル化し、元の質問内のスパンを予測することで、より単純な1ホップ質問を生成する。
  • 各生成された部分質問は、既存の1ホップ読解モデルを用いて回答され、モジュール型かつスケーラブルな推論を可能にする。
  • 分解スコアラーは、全コンテキストと部分質問の回答を考慮して、複数の可能な分解経路を評価し、最も整合性があり正確な最終回答を選択する。
  • 2段階のプロセスを採用する:まず複数の候補となる分解経路を生成し、次に回答の一貫性とコンテキストとの整合性に基づいて各分解を再スコアリングする。
  • 関係論理形式や遠隔監視に依存せず、最小限の人的ラベルデータ(400例)で十分な監視を可能にする。
  • 最終回答は単一の分解に基づくのではなく、全可能な推論経路を考慮したグローバル最適化によって選択される。

実験結果

リサーチクエスチョン

  • RQ1スパン予測アプローチを用いて、わずか400例のラベル付き例題で、マルチホップ読解の部分質問生成を効果的に学習できるか?
  • RQ2複数の分解経路を評価するグローバルな再スコアリング機構は、単一の分解選択に比べて性能を向上させるか?
  • RQ3最小限のデータで学習したニューラル部分質問生成モデルの性能は、人手で作成された部分質問と比べてどの程度か?
  • RQ4分解ベースのアプローチは、エンドツーエンドモデルと比較して、悪意のある分散パラグラフに対してどの程度頑健性を示すか?
  • RQ5分解ベースのモデルがマルチホップ読解で示す主な失敗モードは何か?

主な発見

  • DecompRCは、HotpotQAベンチマークのドレインターやフル・ウィキ設定の両方で最先端の性能を達成した。
  • わずか400例のラベル付き分解例題で学習したモデルは、正確な回答予測を導くために、人手で書かれた部分質問と同等の効果を発揮した。
  • コンテキストに依存した評価に基づき、最良の分解経路を選択することで、グローバルな再スコアリング機構が性能を顕著に向上させた。
  • 分散パラグラフを含む悪意ある設定において、強いBERTベースのエンドツーエンドベースラインを上回り、より高い頑健性を示した。
  • 人間による評価では、スパンベースの部分質問(人間のRCモデルを用いて)の上限F1スコアは72.67に達し、失敗の47%が固有の分解の制限に起因していることが示された。
  • 失敗要因の分析から、3つの主要な失敗モードが特定された:暗黙のマルチホップ推論、共通知識推論を要する明示的な答えの欠如、カウントや算術的推論ができないこと。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。