Skip to main content
QUICK REVIEW

[論文レビュー] Know What You Don't Know: Unanswerable Questions for SQuAD

Pranav Rajpurkar, Robin Jia|arXiv (Cornell University)|Jun 11, 2018
Topic Modeling被引用数 211
ひとこと要約

この論文は SQuAD 2.0 を導入します。SQuAD 1.1 の回答可能な質問と、53,000を超える人間作成の回答不能質問を組み合わせたデータセットで、段落に答えがサポートされていない場合にはモデルが abstain することを強制します。

ABSTRACT

Extractive reading comprehension systems can often locate the correct answer to a question in a context document, but they also tend to make unreliable guesses on questions for which the correct answer is not stated in the context. Existing datasets either focus exclusively on answerable questions, or use automatically generated unanswerable questions that are easy to identify. To address these weaknesses, we present SQuAD 2.0, the latest version of the Stanford Question Answering Dataset (SQuAD). SQuAD 2.0 combines existing SQuAD data with over 50,000 unanswerable questions written adversarially by crowdworkers to look similar to answerable ones. To do well on SQuAD 2.0, systems must not only answer questions when possible, but also determine when no answer is supported by the paragraph and abstain from answering. SQuAD 2.0 is a challenging natural language understanding task for existing models: a strong neural system that gets 86% F1 on SQuAD 1.1 achieves only 66% F1 on SQuAD 2.0.

研究の動機と目的

  • スパン抽出を超えた真の理解をテストするための回答不能な質問の必要性を動機づける。
  • 段落に妥当な答えがあり得る関連する回答不能質問を含む、大規模で高品質なデータセットを作成する。
  • 現行のモデルを評価し、機械と人間の性能ギャップを示す挑戦的なベンチマークを確立する。
  • 自動生成されたネガティブ例は、人間作成の敵対的な回答不能よりモデルにとって容易であることを示す。

提案手法

  • クラウドワーカーが段落内の事実を参照し、妥当な回答を持つ回答不能な質問を、段落ごとに最大5件作成する。
  • SQuAD 1.1 の回答可能な質問と 53,775 問の回答不能質問を組み合わせて SQuAD 2.0 を構成する。
  • データを訓練/開発/テストに分割し、開発/テストでは回答可能/回答不能が概ね均衡するようにする;訓練にはポジティブが多い。
  • 既存のモデル(BiDAF-No-Answer、ELMoあり/なしのDocQA)を、回答不能性を予測し閾値を超えて回避することによって評価する。
  • 自動生成ネガティブ例(TfIdf、RuleBased)と比較して難易度を評価する。
  • 人間の性能とクラウドワーカーが提供する distractor の妥当性を手動評価を通じて分析する。

実験結果

リサーチクエスチョン

  • RQ1読解モデルは、段落が質問への答えを含意していない場合を判定できるか?
  • RQ2敵対的な回答不能質問を追加することは、SQuAD 1.1と比較してモデルの性能にどう影響するか?
  • RQ3人間が作成した回答不能な質問は、自動生成されたネガティブより難しいか?
  • RQ4もっともらしい誤解要素は、モデルと人間の双方をうまく惑わせるか?

主な発見

  • SQuAD 2.0 は最先端モデルにとって依然として SQuAD 1.1 よりも大幅に難しく、(テストでの最良モデル ~66.3 F1 に対し、人間は 89.5 F1)。
  • 自動ネガティブ(TfIdf/RuleBased)は人間作成の回答不能よりモデルにとって容易で、開発/テストで F1 ギャップが大きい。
  • もっともらしいが不正解の回答は、機械・人間双方の誤検出の約半数を占め、誤配慮要因としてのデリストラクターとしての有用性を裏付ける。
  • SQuAD 2.0 の開発/テストにおける人間の正解率は 89.0/89.5 F1、一方でモデルの性能は約23ポイント遅れている(SQuAD 1.1 よりギャップ拡大)。
  • データセットは否定/反意語置換を超えた多様なネガティブ例を示し、サンプルされたネガティブの 93% は真に回答不能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。