Skip to main content
QUICK REVIEW

[論文レビュー] Why Machine Reading Comprehension Models Learn Shortcuts?

Yuxuan Lai, Chen Zhang|arXiv (Cornell University)|Jun 2, 2021
Topic Modeling参考文献 28被引用数 4
ひとこと要約

この論文は、機械読解(MRC)モデルが真の理解力ではなくショートカット解法を学習する理由を調査する。2つの合成データセット(ショートカット質問と挑戦的質問のペアを含む)を用いて、モデルはショートカット質問をより早くかつ容易に学習する。これは勾配最適化の優先度が高いためであり、訓練データにショートカット質問が多数含まれると、並び替えや共参照解決といった複雑な推論スキルの発達が妨げられる。

ABSTRACT

Recent studies report that many machine reading comprehension (MRC) models can perform closely to or even better than humans on benchmark datasets. However, existing works indicate that many MRC models may learn shortcuts to outwit these benchmarks, but the performance is unsatisfactory in real-world applications. In this work, we attempt to explore, instead of the expected comprehension skills, why these models learn the shortcuts. Based on the observation that a large portion of questions in current datasets have shortcut solutions, we argue that larger proportion of shortcut questions in training data make models rely on shortcut tricks excessively. To investigate this hypothesis, we carefully design two synthetic datasets with annotations that indicate whether a question can be answered using shortcut solutions. We further propose two new methods to quantitatively analyze the learning difficulty regarding shortcut and challenging questions, and revealing the inherent learning mechanism behind the different performance between the two kinds of questions. A thorough empirical analysis shows that MRC models tend to learn shortcut questions earlier than challenging questions, and the high proportions of shortcut questions in training sets hinder models from exploring the sophisticated reasoning skills in the later stage of training.

研究の動機と目的

  • MRCモデルが意図された理解力(例:並び替えや共参照解決)ではなくショートカット解法を学習する理由を調査すること。
  • ショートカット質問と挑戦的質問をラベル付けしたデータセットの不足により、モデルの学習行動の実証的分析が制限されているという問題に対処すること。
  • 訓練データにおけるショートカット質問の割合が、モデルの学習ダイナミクスおよび挑戦的推論タスクにおけるパフォーマンスに与える影響を定量化すること。
  • ショートカット質問と複雑な推論質問の間でのモデルパフォーマンス差の背後にある学習メカニズムをプローブする手法を開発すること。

提案手法

  • 各(本文, 質問)ペアにショートカット版と、並び替えや共参照解決を要する挑戦的版を持つ2つの合成MRCデータセットを設計する。
  • ペアの質問がスタイル、長さ、トピックでほぼ同一になるようにし、推論の複雑さの影響を明確に分離する。
  • 訓練中にショートカット質問と挑戦的質問のセットの学習難易度を定量的に測定する2つの評価手法を提案する。
  • 勾配に基づく最適化解析を用いて、モデルがいつショートカット回答と挑戦的回答を学習するかを追跡し、学習優先度を特定する。
  • BiDAFおよびBERTモデルを、ショートカット質問の割合を変化させたデータで学習させ、学習ダイナミクスとパフォーマンスの変化を観察する。
  • ステップごとの正答率の追跡を通じて、モデルが各質問タイプで初めて正解を達成したタイミングを分析する。

実験結果

リサーチクエスチョン

  • RQ1なぜMRCモデルは、意図された理解力よりもショートカット解法をより簡単に学習するのか?
  • RQ2訓練データにおけるショートカット質問の割合が、複雑な推論スキルの学習にどのように影響するのか?
  • RQ3モデルは、ショートカット質問と挑戦的質問のどちらを訓練のどの段階で学習するのか?
  • RQ4勾配最適化は、より深い推論よりもショートカット学習を優先する役割を果たすのか?
  • RQ5ショートカット質問と挑戦的質問の間の学習難易度の差を定量的に測定できるか?

主な発見

  • モデルはショートカット質問を挑戦的質問よりも顕著に早く学習する。BERTでは、ショートカット質問をたった380ステップの訓練で正しく回答する。
  • 同じ訓練設定下で、並び替えに基づく挑戦的質問は630ステップ目まで正しく回答されないため、明確な学習遅延が確認された。
  • 訓練データにショートカット質問の割合が高いと、モデルはショートカットに過度に依存し、後続の訓練段階で複雑な推論スキルの習得意欲が低下する。
  • 勾配に基づく最適化手法は、訓練初期にショートカットパターンの適合を優先するため、洗練された推論スキルの探求を妨げる。
  • 合成データセットは推論の複雑さを効果的に分離できており、モデルの学習行動を制御された環境で分析可能である。
  • 結果は、モデルが容易な意思決定境界を最初に学習する傾向にあることを実証的に確認しており、MRCにおけるショートカット質問はこうした容易な境界を表している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。