Skip to main content
QUICK REVIEW

[論文レビュー] QuALITY: Question Answering with Long Input Texts, Yes!

Richard Yuanzhe Pang, Alicia Parrish|arXiv (Cornell University)|Dec 16, 2021
Topic Modeling被引用数 10
ひとこと要約

QuALITYは、平均5,000トークンの長い英語の本文を含む複数選択式の質問応答データセットを導入し、表面的な検索ではなく包括的理解を試すことを目的としている。このデータセットは、標準的およびタイム制限付きの二重アノテーションパイプラインを用いて、深層的理解を要する質問を保証しており、モデル(55.4%)と人間(93.5%)の間で顕著な性能差を示しており、NLPにおける長文脈理解の難しさを浮き彫りにしている。

ABSTRACT

To enable building and testing models on long-document comprehension, we introduce QuALITY, a multiple-choice QA dataset with context passages in English that have an average length of about 5,000 tokens, much longer than typical current models can process. Unlike in prior work with passages, our questions are written and validated by contributors who have read the entire passage, rather than relying on summaries or excerpts. In addition, only half of the questions are answerable by annotators working under tight time constraints, indicating that skimming and simple search are not enough to consistently perform well. Our baseline models perform poorly on this task (55.4%) and significantly lag behind human performance (93.5%).

研究の動機と目的

  • 長文の質問応答に適した高品質なベンチマークの不足に対処し、表面的な検索ではなく包括的理解を要するものであることを目的とする。
  • 読者が本文を完全に読み終えた上で質問を作成・検証するデータセットを構築し、文脈的な深さと曖昧でない回答を保証することを目的とする。
  • タイム制限あり・なしの条件での性能比較を通じて、本文全体の理解を要する質問を同定するためのクラウドソーシングパイプラインを設計することを目的とする。
  • 現在のモデルが長文脈を処理する際、特に複数のセクションにわたる推論を要する状況でどの程度制限を受けるかを評価することを目的とする。
  • 短文脈処理を超えた長文脈NLPの限界を試すベンチマークを確立することを目的とする。

提案手法

  • 著者が本文をすべて読み終えた上で、1記事あたり10の質問を生成するクラウドソーシングパイプラインを採用し、曖昧でなく、テキスト全体にわたる情報統合を要する質問を保証する。
  • 各質問は、全本文を読んだ5名のタイムリーなアノテーターと、45秒間のみで回答する5名のタイム制限付きアノテーターによって検証される。
  • タイムリーなアノテーターが正しく回答するが、タイム制限付きアノテーターが正しく回答しない質問は「難易度の高い」ものと分類され、キーワード検索を超える深層的理解を要することが示される。
  • 評価の簡素化と自由記述生成メトリクスの曖昧さを回避するため、複数選択形式を採用する。
  • ベースラインモデルは、RoBERTa、DeBERTaV3、Longformerアーサイテクチャを用い、標準的な微調整プロトコルに従ってQuALITYで微調整される。
  • リtrievalと読解のコンponentの寄与度を分離するためにオラクルベースのリtrieval手法が用いられ、完全な回答が与えられた場合でも、モデルの性能が依然として低いことが示された。

実験結果

リサーチクエスチョン

  • RQ1モデルは、短い抜粋に依存するのではなく、全文にわたる情報統合を要する長文のQAで高い性能を達成できるか?
  • RQ2現在のモデルは人間の読者と比べてどの程度長文脈を理解できないのか、そのギャップを生じさせる要因は何か?
  • RQ3タイム制限あり/なしの二重アノテーションパイプラインは、包括的理解を要する質問を効果的に同定できるか?
  • RQ4生成的評価メトリクスの曖昧さを避けるために、複数選択形式は長文脈理解を効果的に評価できるか?
  • RQ5二段階QAモデルにおける、リtrievalと読解コンponentの相対的寄与度は、長文脈タスクにおいてどの程度か?

主な発見

  • 最良のベースラインモデル、DeBERTaV3-largeは、QuALITY開発セット全体で71.9%の正確性にとどまり、人間の性能より顕著に低い。
  • QuALITYにおける人間の性能は93.5%であり、モデルと人間の間で38.1%の顕著な性能ギャップがあることが示された。
  • オラクル回答をクエリとして使用しても、最良のモデルは77.8%の正確性にとどまり、リtrievalと読解の両コンponentが長文脈設定で依然として挑戦的であることが示された。
  • 語彙的オーバーラップヒューリスティック(回答選択肢とテキストの一致)は26.6%の正確性にとどまり、モデルが単純な表面一致に依存できないことが証明された。
  • タイム制限による検証で特定された「難易度の高い」質問は、顕著に困難である:モデルの性能が著しく低く、本文全体の理解を要することが示された。
  • RACEベンチマーク(短い文脈を用いる)では、DeBERTaV3-largeの性能は57.5%にとどまり、QuALITYの長文脈設計が難易度を顕著に高めていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。