Skip to main content
QUICK REVIEW

[論文レビュー] ORB: An Open Reading Benchmark for Comprehensive Evaluation of Machine Reading Comprehension

Dheeru Dua, Ananth Gottumukkala|arXiv (Cornell University)|Dec 29, 2019
Topic Modeling参考文献 19被引用数 14
ひとこと要約

ORBは、コアファレンス解決、推論、分布外一般化の能力をテストする7つの多様なデータセットをカバーする、マシン読解モデルの包括的で統一的な評価を可能にするオープン評価ベンチマークです。訓練制限なしに複数のデータセット(隠しテストセットを含む)でのモデル評価をサポートし、NLUシステムの堅牢性と一般化能力を促進します。

ABSTRACT

Reading comprehension is one of the crucial tasks for furthering research in natural language understanding. A lot of diverse reading comprehension datasets have recently been introduced to study various phenomena in natural language, ranging from simple paraphrase matching and entity typing to entity tracking and understanding the implications of the context. Given the availability of many such datasets, comprehensive and reliable evaluation is tedious and time-consuming for researchers working on this problem. We present an evaluation server, ORB, that reports performance on seven diverse reading comprehension datasets, encouraging and facilitating testing a single model's capability in understanding a wide variety of reading phenomena. The evaluation server places no restrictions on how models are trained, so it is a suitable test bed for exploring training paradigms and representation learning for general reading facility. As more suitable datasets are released, they will be added to the evaluation server. We also collect and include synthetic augmentations for these datasets, testing how well models can handle out-of-domain questions.

研究の動機と目的

  • 複数の多様なデータセットにわたるマシン読解モデルの評価という課題に取り組むこと。これは時間のかかる作業であり、データセット固有の過学習のリスクを伴う。
  • コアファレンス、推論、言い換えなどの多様な言語現象を含む、1つのモデルの一般化能力を包括的に評価することを容易にすること。
  • 隠しテストセットと合成データ拡張をサポートする標準化されたオープン評価プラットフォームを提供し、分布外一般化の評価を可能にすること。
  • 訓練制限なしに複数のデータセットを横断して評価できる仕組みを提供することで、堅牢で汎用的な読解システムの開発を促進すること。
  • 今後リリースされる高品質な読解データセットの今後の統合を支援し、ベンチマークが最新かつ包括的であることを保証すること。

提案手法

  • 7つの既存の読解データセット(開発セットおよび隠しテストセットを含む)における推論をサポートする評価サーバーを設計すること。
  • 2つの基準に基づいてデータセットを選定する:複数選択形式を除外すること、および単一のパassageに限定された独立した質問応答タスクに焦点を当てることにより、情報抽出や対話の複雑さから読解能力を分離すること。
  • 既存の質問変換技術(例:選択肢の反転、含意、SEARs)から得られる合成データ拡張を統合し、モデルの分布シフトに対する堅牢性をテストすること。
  • すべてのデータセットを一貫した推論条件で評価し、モデルアーキテクチャーや訓練手法に制限を設けないこと。
  • 公開リーダーボードとオープンソースコードを併用した評価サーバーをホスティングし、https://leaderboard.allenai.org/orb で公開することで、再現可能で透明性のあるベンチマーク評価を可能にすること。
  • すべてのデータセットで同一の入力フォーマットで評価されるモデルのみを採用し、公正で比較可能な性能測定を保証すること。

実験結果

リサーチクエスチョン

  • RQ11つのマシン読解モデルが、重複のない多様な読解データセットで一貫した高い性能を発揮できるか?
  • RQ2合成データ拡張は、分布外の質問へのモデル一般化能力の評価をどの程度向上させられるか?
  • RQ3マルチスパンおよびコアファレンス解決を要する、推論が重視されるデータセット(例:DROP や Quoref)において、既存のモデルはどの程度の性能を示すか?
  • RQ4複数のデータセットを同時に評価することで、個々のデータセットに内在するバイアスへの過学習が軽減されるか?
  • RQ5統一された評価プラットフォームは、より堅牢で汎用的な読解システムの開発を促進できるか?

主な発見

  • ORBベンチマークは、訓練制限なしに7つの多様な読解データセット(隠しテストセットを含む)における1つのモデルの評価を可能にしている。
  • 逆選択肢、含意に基づく変換、SEARs(So-質問)などの合成拡張が、成功裏に生成され統合され、モデルの堅牢性をテストした。
  • SQuAD 1.1 と 2.0 における性能は、それぞれ F1 スコア 40.03 と 49.07 であった。これはスパン抽出タスクにおけるベースライン性能を示している。
  • DuoRC では、開発セットで F1 スコア 25.65、テストセットで 34.28 を記録し、言い換え理解の難しさが浮き彫りになった。
  • Quoref と DROP データセットでは顕著な性能差が見られ、F1 スコアはそれぞれ 24.08 と 31.74 であった。これはコアファレンスやマルチステップ推論の困難さを示している。
  • ベンチマークの設計は、今後の新しいデータセットの統合をサポートしており、そのオープンな評価インfraは透明性があり再現可能なモデル比較を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。