Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Prior Knowledge for Challenging Chinese Machine Reading Comprehension

Kai Sun, Dian Yu|arXiv (Cornell University)|Apr 21, 2019
Topic Modeling被引用数 9
ひとこと要約

本稿では、本物の中国語第二言語試験から抽出された自由形式の複数選択式中国語機械読解データセットC3を紹介する。このデータセットは、文章内容と多様な事前知識(文語的知識、分野固有の知識、一般世界知識)の統合を要する。最新のモデルで68.5%の正答率を達成したが、人間の正答率96.0%と比べて大きな格差が残っており、事前知識の重要性と英語MRCデータセットからのデータ拡張の限界が浮き彫りになる。

ABSTRACT

Machine reading comprehension tasks require a machine reader to answer questions relevant to the given document. In this paper, we present the first free-form multiple-Choice Chinese machine reading Comprehension dataset (C^3), containing 13,369 documents (dialogues or more formally written mixed-genre texts) and their associated 19,577 multiple-choice free-form questions collected from Chinese-as-a-second-language examinations. We present a comprehensive analysis of the prior knowledge (i.e., linguistic, domain-specific, and general world knowledge) needed for these real-world problems. We implement rule-based and popular neural methods and find that there is still a significant performance gap between the best performing model (68.5%) and human readers (96.0%), especially on problems that require prior knowledge. We further study the effects of distractor plausibility and data augmentation based on translated relevant datasets for English on model performance. We expect C^3 to present great challenges to existing systems as answering 86.8% of questions requires both knowledge within and beyond the accompanying document, and we hope that C^3 can serve as a platform to study how to leverage various kinds of prior knowledge to better understand a given written or orally oriented text. C^3 is available at https://dataset.org/c3/.

研究の動機と目的

  • 中国語第二言語試験の現実的な読解要件を反映した、自由形式の複数選択式MRCデータセットの開発。
  • 本データセットの質問を解くために必要な事前知識の種類と役割(文語的知識、分野固有の知識、一般世界知識)の分析。
  • 誘導選択肢の妥当性と、英語MRCデータセットを翻訳して得たデータ拡張がモデル性能に与える影響の評価。
  • ニューラルモデルの進歩にもかかわらず未解決のままの中国語MRCの主な課題の特定。
  • 多言語およびクロスリンガル機械読解における事前知識の活用に関する今後の研究のベンチマーク提供。

提案手法

  • C3は本物の中国語第二言語試験から構築され、13,369件の文書(対話文および混合ジャンルの文章)と19,577件の自由形式複数選択式質問を含む。
  • 本データセットには2つのサブタスクが含まれる:対話文に基づく読解のための${\text{C}}_{\text{D}}^{3}$と、形式的な文章(混合ジャンル)を対象とした${\text{C}}_{\text{M}}^{3}$。
  • 事前知識の種類は体系的にアノテートされ、文語的知識、分野固有の知識、および一般世界知識の8つのサブタイプ(例:因果関係、含意、算術)に分類される。
  • 誘導選択肢の妥当性は、誘導選択肢語と文書間の類似度スコア$\mathcal{S}(w_i, d)$で測定され、$\max_i \mathcal{S}(w_i, d)$が難易度の代理指標として用いられる。
  • BERT、Co-Matching、BERT-wwm-extなどのニューラルモデルをC3で微調整し、知識要求の高い質問タイプにおける性能を評価する。
  • データ拡張は、Google Translateを用いて英語MRCデータセット(RACEおよびDREAM)を中国語に翻訳し、C3の学習データと統合することで実施される。

実験結果

リサーチクエスチョン

  • RQ1C3データセットの質問を解くために必要な事前知識の種類と割合は何か。また、文書タイプごとにそれらはどのように異なるか。
  • RQ2誘導選択肢の妥当性は、中国語MRCにおける質問の難易度とモデル性能にどのように相関するか。
  • RQ3翻訳された英語MRCデータセットを用いたデータ拡張が、C3ベンチマークにおける性能向上にどの程度寄与するか。
  • RQ4最新のモデルとデータ拡張を用いても、C3における性能が人間水準に著しく下回る理由は何か。
  • RQ5文語的知識と世界知識などの異なる種類の事前知識は、モデルの行動と誤りパターンにどのように影響するか。

主な発見

  • C3の86.8%の質問が文書に記載された内容を超える知識を要しており、そのうち57.3%が一般世界知識を必要としており、高い複雑性が示された。
  • 最も高い性能を示したモデル(BERT-wwm-ext)は68.5%の正答率を達成したが、人間の正答率は96.0%であり、顕著な性能格差が確認された。
  • 誘導選択肢の妥当性はモデルの難易度と強く相関しており、最も妥当な誘導選択肢が文書と類似度が高い場合、性能が著しく低下した。
  • RACEおよびDREAMから得た94,000件の翻訳英語インスタンスを用いたデータ拡張により、正答率は67.8%から72.4%に僅か4.6%向上したが、これは転送性が限定的であることを示唆した。
  • C3と英語MRCデータを両方で多言語BERTを微調整した場合、C3単体で中国語BERTを微調整した場合(65.7%)より性能が低かった(63.4%)ため、クロスリンガル転送が最適でないことが示された。
  • 正答が文書に明示的に記載されていない場合($\mathcal{S}(c,d)$が低い場合)、一般世界知識が極めて重要になる。一方、誘導選択肢が文書と類似度が高い場合($\max_i \mathcal{S}(w_i,d)$が高い場合)、文語的知識がより重要になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。