Skip to main content
QUICK REVIEW

[論文レビュー] PALRACE: Reading Comprehension Dataset with Human Data and Labeled Rationales

Jiajie Zou, Yuran Zhang|arXiv (Cornell University)|Jun 23, 2021
Topic Modeling参考文献 9被引用数 5
ひとこと要約

PALRACEは、RACEコーパスから抽出された800の本文と、6種類の質問タイプごとに人間がラベル付けした推論根拠を備えた読解理解データセットを紹介する。RoBERTa-largeのようなモデルは、全6種類の質問タイプにおいて人間を上回る性能を示すが、人間の推論根拠が提供されると、特に単純なモデルやファインチューニングを行わないモデルにおいて、性能が顕著に向上し、一部のケースでは30%以上の向上が見られた。

ABSTRACT

Pre-trained language models achieves high performance on machine reading comprehension (MRC) tasks but the results are hard to explain. An appealing approach to make models explainable is to provide rationales for its decision. To investigate whether human rationales can further improve current models and to facilitate supervised learning of human rationales, here we present PALRACE (Pruned And Labeled RACE), a new MRC dataset with human labeled rationales for 800 passages selected from the RACE dataset. We further classified the question to each passage into 6 types. Each passage was read by at least 26 human readers, who labeled their rationales to answer the question. It is demonstrated that models such as RoBERTa-large outperforms human readers in all 6 types of questions, including inference questions, but its performance can be further improved when having access to the human rationales. Simpler models and pre-trained models that are not fine-tuned based on the task benefit more from human rationales, and their performance can be boosted by more than 30% by rationales. With access to human rationales, a simple model based on the GloVe word embedding can reach the performance of BERT-base.

研究の動機と目的

  • モデルの解釈可能性を向上させるために、人間がラベル付けした推論根拠を備えた読解理解データセットの構築を目的とする。
  • 事前学習された言語モデルの性能を、現在の最先端の結果を超えて向上させるために、人間の推論根拠が有効であるかどうかを調査することを目的とする。
  • 推論や事実に関する質問を含む、さまざまな種類の読解理解質問に対する推論根拠の影響を調査することを目的とする。
  • ファインチューニングを行わないモデルを含め、強力なモデルと単純なモデルの両方における推論根拠の有効性を評価することを目的とする。
  • 機械読解における人間の推論根拠の教師あり学習のベンチマークを提供することを目的とする。

提案手法

  • 読解理解の多様なレベルと内容をカバーするRACEデータセットから800の本文を選定した。
  • 各本文-質問ペアに対して、少なくとも26人の人間がラベル付けした推論根拠を収集した。
  • 推論の複雑さと理解の深さを基準に、6種類の質問タイプを分類した。
  • RoBERTa-largeおよびその他のモデルを、人間の推論根拠の有無を変えて訓練し、性能を比較した。
  • 低リソースまたはファインチューニングを行わないモデルに対する推論根拠の影響を評価するために、単純なGloVeベースのモデルを用いた。
  • 全6種類の質問タイプにおいてモデルの性能を評価し、正確性と推論根拠統合による向上幅を測定した。

実験結果

リサーチクエスチョン

  • RQ1人間がラベル付けした推論根拠は、読解理解タスクにおける事前学習言語モデルの性能を向上させることができるか?
  • RQ2モデルが単純であるか、タスク固有のファインチューニングを行わない場合、推論根拠がより大きな利益をもたらすか?
  • RQ3推論根拠の導入が、さまざまな種類の読解理解質問における性能にどのように影響するか?
  • RQ4ファインチューニングを行わないGloVeベースのモデルが、人間の推論根拠を提供された場合、BERT-baseと同等の性能を達成できるか?
  • RQ5人間の読解者と最先端のモデルの間には、同じ推論根拠を共有した場合に、測定可能な性能差が存在するか?

主な発見

  • RoBERTa-largeは、複雑な推論質問を含め、全6種類の質問タイプにおいて人間の読解者を上回る性能を示した。
  • ファインチューニングを行わない、または単純なモデル(例:GloVeベース)は、人間の推論根拠により30%を超える性能向上を達成した。
  • GloVe埋め込みのみを用いた単純なモデルが、人間がラベル付けした推論根拠を提供された場合、BERT-baseと同等の性能を達成した。
  • 人間の推論根拠の導入は、全6種類の質問タイプにおいて一貫してモデルの性能を向上させ、特にファインチューニングを行わないモデルで最も顕著な向上が見られた。
  • RoBERTa-largeのような高性能モデルですら、人間の推論根拠へのアクセスを有することで測定可能な性能向上を示し、推論根拠が推論の正確性を向上させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。