Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the Benchmarking Capacity of Machine Reading Comprehension Datasets

Saku Sugawara, Pontus Stenetorp|arXiv (Cornell University)|Nov 21, 2019
Topic Modeling参考文献 34被引用数 4
ひとこと要約

本稿では、機械読解(MRC)データセットが本当に高度な言語理解能力をベンチマークしているかどうかを評価するための、半自動的でアブレーションベースの手法を提案する。特定の言語的スキルに関連する特徴(例:コンテンツ語、文の順序、品詞タグ)を体系的に削除することで、強力なベースラインモデルがコンテンツ語のみのバージョンでは元の性能の89.2%、語順をシャッフルしたバージョンでは78.5%の性能を達成することが示された。これは、既存のMRCの質問の多くが深層的理解ではなく表面的ヒントに依存していることを示している。

ABSTRACT

Existing analysis work in machine reading comprehension (MRC) is largely concerned with evaluating the capabilities of systems. However, the capabilities of datasets are not assessed for benchmarking language understanding precisely. We propose a semi-automated, ablation-based methodology for this challenge; By checking whether questions can be solved even after removing features associated with a skill requisite for language understanding, we evaluate to what degree the questions do not require the skill. Experiments on 10 datasets (e.g., CoQA, SQuAD v2.0, and RACE) with a strong baseline model show that, for example, the relative scores of a baseline model provided with content words only and with shuffled sentence words in the context are on average 89.2% and 78.5% of the original score, respectively. These results suggest that most of the questions already answered correctly by the model do not necessarily require grammatical and complex reasoning. For precise benchmarking, MRC datasets will need to take extra care in their design to ensure that questions can correctly evaluate the intended skills.

研究の動機と目的

  • MRCデータセットが真の言語理解能力をベンチマークできるかどうかの体系的評価が不足しているという問題に対処すること。
  • 既存のMRC質問が複雑な推論や文法的理解を必要としているのか、それとも表面的なパターンによって解けるのかを調査すること。
  • 必要なスキルに基づいて、MRCデータセットのベンチマーク能力を評価するためのスケーラブルで半自動的な手法を開発すること。
  • モデルが意図されたNLU能力を習得していなくても成功してしまう、現在のデータセットにおける設計上の欠陥を特定すること。

提案手法

  • 特定の言語的スキルに関連する特徴を削除するように体系的に入力テキストと質問を変更する、半自動的でアブレーションベースの手法を提案する。
  • コアファレンス解決や時系列的推論、語彙的推論など、12の必須スキル(読解と推論のカテゴリに分類)を定義する。
  • モデルの耐性をテストするために、語彙の匿名化、文のシャッフル、品詞(POS)タグ付けなどの入力アブレーション技術を適用する。
  • 強いベースラインモデル(例:BERTベース)を用いて、アブレーション処理済み入力での性能を評価し、元の性能との相対的なスコアを比較する。
  • 人間によるアノテーションを用いて、アブレーション処理された特徴の再構築可能性と、正解に必要なかどうかを評価し、特徴が推測可能か、あるいは本質的かを区別する。
  • 抽出型と複数選択型の2つの回答スタイルを対象として、10の既存MRCデータセット(例:CoQA、SQuAD v2.0、RACE)を分析する。

実験結果

リサーチクエスチョン

  • RQ1既存のMRCデータセットは、コアファレンス解決や因果的推論といった、深い言語理解をどの程度必要としているのか?
  • RQ2コンテンツ語、文の順序、品詞タグを削除した後でも、強力なベースラインモデルがMRC質問を解けるかどうか。これは表面的パターンに依存しているかどうかを示唆する。
  • RQ3アブレーション処理された特徴(例:機能語、語順)は人間によって再構築可能か?また、正解に本当に必要か?
  • RQ4アブレーション処理された入力における相対的スコアは、MRCデータセットが複雑なNLUスキルを評価するためのベンチマーク能力をどの程度反映しているか?
  • RQ5MRCデータセットが意図された言語理解能力を適切に評価できるようにするための設計原則は何か?

主な発見

  • 平均して、ベースラインモデルは文と質問にコンテンツ語のみを保持した状態でも、元のF1スコアの89.2%を達成しており、表面的ヒントに強く依存していることが示された。
  • 文の語順をシャッフルした場合、モデルの性能は元のスコアの78.5%に低下した。これは、語順や文法的構造が正解に必ずしも不可欠でないことを示している。
  • シャッフルされた文の順序でも、モデルの性能は元のスコアの95.4%を維持した。これは、文レベルの文法的構造がモデルの成功にとってしばしば重要ではないことを示している。
  • 人間によるアノテーションの結果、多くの質問においてアブレーション処理された特徴(例:機能語)は再構築可能ではなく、たとえ推測可能でも正解に必要ではないことが判明した。
  • Case δ(再構築可能でかつ必須の特徴)に該当する質問は一切発見されなかった。これは、多くの質問が深層的言語理解を必要としないまま解けることを示している。
  • これらの結果は総合的に、多くの既存MRC質問が複雑な言語理解を評価するのに不十分であり、モデルが真の理解ではなくパターンマッチングによって成功してしまう可能性があることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。