Skip to main content
QUICK REVIEW

[論文レビュー] Reasoning Over Paragraph Effects in Situations

Kevin Lin, Oyvind Tafjord|arXiv (Cornell University)|Aug 16, 2019
Topic Modeling参考文献 17被引用数 8
ひとこと要約

ROPESは、新しい状況における因果的要因の推論能力を評価する14,322問の読解ベンチマークである。微調整を施したRoBERTa-largeを用いても、最高スコアは61.6% F1にとどまり、人間のパフォーマンス(89.0%)とは著しく差がある。これは、テクスト知識を新しい文脈に適用する難しさを示している。

ABSTRACT

A key component of successfully reading a passage of text is the ability to apply knowledge gained from the passage to a new situation. In order to facilitate progress on this kind of reading, we present ROPES, a challenging benchmark for reading comprehension targeting Reasoning Over Paragraph Effects in Situations. We target expository language describing causes and effects (e.g., "animal pollinators increase efficiency of fertilization in flowers"), as they have clear implications for new situations. A system is presented a background passage containing at least one of these relations, a novel situation that uses this background, and questions that require reasoning about effects of the relationships in the background passage in the context of the situation. We collect background passages from science textbooks and Wikipedia that contain such phenomena, and ask crowd workers to author situations, questions, and answers, resulting in a 14,322 question dataset. We analyze the challenges of this task and evaluate the performance of state-of-the-art reading comprehension models. The best model performs only slightly better than randomly guessing an answer of the correct type, at 61.6% F1, well below the human performance of 89.0%.

研究の動機と目的

  • 局所的な事実抽出を超えて、新しい状況における因果的要因の推論をテストする読解ベンチマークの開発を目的とする。
  • 既存のデータセットが局所的な述語項構造に焦点を当てているのに対し、知識を新しい文脈に適用するというギャップを埋める。
  • 最先端のモデルが背景本文から得た因果的理解を、現実世界の状況に一般化できるかどうかを評価すること。
  • 多様で高品質なデータセットを構築し、さまざまな推論タイプと語彙的ギャップを含め、推論一般化の挑戦を促進すること。

提案手法

  • 因果関係(原因と結果)に焦点を当て、科学教科書およびWikipediaから背景本文を収集した。
  • クラウドワーカーがこれらの本文に基づき、新しい状況、質問、回答を生成し、因果関係と整合性を保った。
  • 質問は4つの推論タイプに分類された:結果比較、原因比較、結果予測、原因予測。
  • アノテーションアーティファクトバイアスを低減するため、トレーニングセットとテストセットのアノテーターを別々に分離した。
  • ベースラインモデルは、ROPESでRoBERTaを微調整し、性能向上のためRACE事前学習を追加で実験した。
  • パフォーマンスベンチマークを確立するため、ランダムに抽出された400件の質問について人間の評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1読解モデルは、背景本文から得た因果的知識を、新しい状況における結果の推論に応用できるか?
  • RQ2背景本文、状況、質問の間で語彙的ギャップや言い換えが生じた場合、モデルのパフォーマンスにどのような影響を与えるか?
  • RQ3現在のモデルにとって、比較、予測、根拠付けのどの推論タイプが最も困難か?
  • RQ4活発なアノテーターによるアノテーションアーティファクトが、このベンチマークにおけるモデルの一般化性能にどの程度影響を与えるか?

主な発見

  • RACE事前学習を施したRoBERTa-largeが最高スコアを記録し、テストセットで61.6% F1を達成したが、2択の質問ではランダムな推測とほとんど差がなかった。
  • 同じテストセットで人間のパフォーマンスは89.0% F1に達しており、現在のモデルと人間との間で推論一般化のギャップが顕著に存在することが示された。
  • 大多数の質問が結果または原因の比較を含んでおり、これは2つの異なる原因または結果の出現を根拠づける必要があるため、特に困難である。
  • 背景本文が欠落した場合、性能が著しく低下した。これは、正確な推論に背景知識が不可欠であることを確認している。
  • このデータセットは多様な推論タイプと語彙的変動を示しており、8%の例で明白でない根拠づけや一般的な常識的推論が含まれている。
  • モデルは語彙的ギャップや言い換えに対し苦戦しており、表面的な一致を超えたより良い意味的一般化の必要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。