Skip to main content
QUICK REVIEW

[論文レビュー] What Makes Reading Comprehension Questions Easier?

Saku Sugawara, Kentaro Inui|arXiv (Cornell University)|Aug 28, 2018
Topic Modeling参考文献 26被引用数 15
ひとこと要約

本研究では、12の最近のMRCデータセットを簡単なヒューリスティクス(エンティティタイプ認識と注目に基づく文類似性マッチング)を用いて簡単なサブセットと難しいサブセットに分割することで、なぜ一部の機械読解(MRC)質問が他の質問よりも簡単であるかを調査している。その結果、難しい質問は知識推論と複数文の推論を要するのに対し、ベースラインモデルは難しいサブセットで著しく性能を落とすことが判明した。これは、現在のMRCベンチマークが、簡単でキューに依存する質問が過剰に含まれているため、モデルの能力を誇張している可能性を示唆している。

ABSTRACT

A challenge in creating a dataset for machine reading comprehension (MRC) is to collect questions that require a sophisticated understanding of language to answer beyond using superficial cues. In this work, we investigate what makes questions easier across recent 12 MRC datasets with three question styles (answer extraction, description, and multiple choice). We propose to employ simple heuristics to split each dataset into easy and hard subsets and examine the performance of two baseline models for each of the subsets. We then manually annotate questions sampled from each subset with both validity and requisite reasoning skills to investigate which skills explain the difference between easy and hard questions. From this study, we observed that (i) the baseline performances for the hard subsets remarkably degrade compared to those of entire datasets, (ii) hard questions require knowledge inference and multiple-sentence reasoning in comparison with easy questions, and (iii) multiple-choice questions tend to require a broader range of reasoning skills than answer extraction and description questions. These results suggest that one might overestimate recent advances in MRC.

研究の動機と目的

  • 最近のMRCデータセットにおける読解質問の難易度に影響を与える要因を調査すること。
  • モデルが表面的なキューに依存するだけで真の理解力ではなく、評価の過適合や意図しないバイアスが生じるリスクを是正すること。
  • 現在のMRCデータセットが本当に高度な推論スキルをテストしているのか、それとも単純なパターンに基づく質問が支配的であるのかを評価すること。
  • 回答抽出、記述、多肢選択の3つの質問スタイルにおける推論要件の違いを比較すること。
  • 有効で挑戦的な質問タイプを特定することで、より現実的なMRCデータセットを構築するためのフレームワークを提供すること。

提案手法

  • 著者らは2つの単純なヒューリスティクスを提案した:(1) エンティティタイプ認識(例:時間、人物など、特定の答えの種類を要する質問を同定)、(2) 注目に基づく文類似性マッチング(質問と最も文脈的に類似した文を同定)。
  • これらのヒューリスティクスを用いて、12のMRCデータセットの各々を、単一文のキューに基づく推論で答えが得られるか、それとも広い文脈を必要とするかによって、簡単なサブセットと難しいサブセットに分割した。
  • ベースラインニューラルモデル2つ(Bidirectional Attention FlowとGated-Attention Reader)を、簡単なサブセットと難しいサブセットの両方で評価し、難しい質問に対して性能がどの程度低下するかを測定した。
  • 各サブセットからサンプルされた質問に対して、手作業によるアノテーション研究を実施し、有効性と必要な推論スキル(語のマッチング、知識推論、複数文の推論など)をラベル付けした。
  • 分析では、質問スタイル(回答抽出、記述、多肢選択)ごとの推論スキルの分布を比較し、これらのスキルがモデル性能に与える影響を評価した。
  • 研究では、タスク固有の過適合に依存するのではなく、スキル志向型の評価アプローチを用いて、データセットが本当に深い理解力をテストしているかどうかを評価した。

実験結果

リサーチクエスチョン

  • RQ1現在のベンチマークデータセットにおいて、なぜ一部のMRC質問が他の質問よりも簡単であるのか?
  • RQ2知識推論などの深い推論を要する難しい質問に直面した際、ベースラインモデルの性能はどの程度低下するか?
  • RQ3知識推論や複数文の推論といった推論スキルは、なぜ難しい質問に多く見られるのか?
  • RQ4回答抽出、記述、多肢選択の異なる質問スタイルは、推論要件と回答可能性においてどのように異なるか?
  • RQ5現在のMRCデータセットは、表面的なキューに依存しており、モデル性能を誇張する可能性があるか?

主な発見

  • ベースラインモデルは、全体のデータセットと比較して、難しいサブセットでは顕著な性能低下を示した。これは、難しい質問が著しく困難であることを示している。
  • 難しい質問は、簡単な質問が単一文の語のマッチング戦略で解けるのに対し、知識推論と複数文の推論をはるかに頻繁に要する。
  • 多肢選択問題は、回答抽出や記述問題よりも広範な推論スキルを要するが、しばしばより回答可能で明確である。
  • 本研究では、現在のMRCデータセットが簡単でキューに依存する質問に偏っていることが判明した。これは、自然言語理解におけるモデルの能力を誇張する可能性がある。
  • ヒューリスティクスに基づく分割法は、深い理解を要する質問を効果的に特定でき、データセット分析やベンチマーク設計の実用的ツールを提供する。
  • 手作業によるアノテーションは、簡単な質問は主に語のマッチングで回答可能であるのに対し、難しい質問は文間の情報統合と推論を要するという点を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。