Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Ask Unanswerable Questions for Machine Reading Comprehension

Haichao Zhu, Li Dong|arXiv (Cornell University)|Jun 14, 2019
Topic Modeling参考文献 46被引用数 4
ひとこと要約

本稿では、対応する段落を条件として、回答可能な質問を編集することで関連性のある回答不能な質問を生成するペア・ツー・シーケンスモデルを提案する。この手法により、機械読解のためのデータ拡張が効果的に行える。BERT-baseおよびBERT-largeモデルを用いたSQuAD 2.0では、語句的に類似した文脈に根ざした回答不能な質問からの判別的トレーニング信号のおかげで、F1スコアがそれぞれ1.9点および1.7点向上した。

ABSTRACT

Machine reading comprehension with unanswerable questions is a challenging task. In this work, we propose a data augmentation technique by automatically generating relevant unanswerable questions according to an answerable question paired with its corresponding paragraph that contains the answer. We introduce a pair-to-sequence model for unanswerable question generation, which effectively captures the interactions between the question and the paragraph. We also present a way to construct training data for our question generation models by leveraging the existing reading comprehension dataset. Experimental results show that the pair-to-sequence model performs consistently better compared with the sequence-to-sequence baseline. We further use the automatically generated unanswerable questions as a means of data augmentation on the SQuAD 2.0 dataset, yielding 1.9 absolute F1 improvement with BERT-base model and 1.7 absolute F1 improvement with BERT-large model.

研究の動機と目的

  • 抽出的タスクで優れた性能を示す一方で、依然として回答不能な質問を検出する能力の向上が機械読解モデルにおける主要な課題であることを踏まえ、その能力を向上させること。
  • 段落に対して語句的および文脈的に関連性のある回答不能な質問を生成し、単純または無関係な例を避けること。
  • 自動生成された回答不能な質問を用いたデータ拡張戦略を開発し、読解モデルの汎化性能および耐障害性を向上させること。
  • 共通の回答スパンをピボットとして、回答可能な質問と回答不能な質問を整合させるトレーニングデータ構築法を設計すること。
  • 生成された回答不能な質問が、SQuAD 2.0におけるモデル性能向上に有効なネガティブ例として機能するかどうかを評価すること。

提案手法

  • 質問と段落を同時にエンコードできるペア・ツー・シーケンスモデルを導入し、注目メカニズムを用いた相互作用と文脈に配慮した表現学習を可能にする。
  • 生成過程で段落からの単語を組み込むコピー機構を採用することで、事実の整合性と関連性が向上する。
  • 回答可能な質問と回答不能な質問を共通の回答スパンで結びつけることで、ピボットに基づくペアを構築する。
  • 段落を条件として、語の置換、否定、エンティティの置き換えなどの操作を用いて回答可能な質問を編集することで、回答不能な質問を生成する。
  • 生成された回答不能な質問と元のSQuAD 2.0の回答可能な例を組み合わせ、BERTベースのモデルでファインチューニングすることでデータ拡張を実施する。
  • 既存の大規模なMRCデータセットを活用し、大規模で文脈に根ざした回答不能な質問セットをトレーニング用に生成する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルモデルは、文脈的に関連性があり、読解モデルにとって判別的である回答不能な質問を生成できるか?
  • RQ2段落を条件として回答可能な質問を編集することで回答不能な質問を生成することは、モデルの汎化性能を向上させるか?
  • RQ3自動生成された回答不能な質問は、特に強力なBERTベースのモデルにおいて、SQuAD 2.0の性能をどの程度向上させられるか?
  • RQ4生成された回答不能な質問の品質は、TF-IDF検索やルールベースのベースラインと比較してどうか?
  • RQ5生成された回答不能な質問の数を増やすことでさらにモデル性能が向上するか?また、限界効果の発現は見られるか?

主な発見

  • ペア・ツー・シーケンスモデルは自動評価および人的評価の両方で、シーケンス・ツー・シーケンスベースラインを上回り、より関連性があり多様な回答不能な質問を生成した。
  • BERT-baseモデルを用いたSQuAD 2.0では、生成された回答不能な質問のおかげでF1スコアが1.9ポイントの絶対的向上を達成した。BERT-largeでは1.7ポイントの向上を記録した。
  • 生成された回答不能な質問を用いたデータ拡張は、特殊なアーキテクチャおよびBERTのファインチューニングを含む複数のモデルで性能向上をもたらした。
  • 拡張データのサイズを3倍まで増やすことでさらに性能向上が見られたが、特にBERT-baseではそれが顕著で、データの多様性に起因するスケーラビリティと利点が示された。
  • ルールベースおよびTF-IDFベースの回答不能な質問生成のベースラインは、ほとんど利益をもたらさず、本稿で提案するペア・ツー・シーケンスアプローチの優位性が浮き彫りになった。
  • 本手法はデータの不均衡を効果的に緩和し、強力なネガティブ例を提供することで、回答がない場合にモデルが回答を控える能力が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。