Skip to main content
QUICK REVIEW

[論文レビュー] Harvesting Paragraph-Level Question-Answer Pairs from Wikipedia

Xinya Du, Claire Cardie|arXiv (Cornell University)|May 15, 2018
Natural Language Processing Techniques被引用数 18
ひとこと要約

本稿では、コアリファレンス知識を独創的なゲーティング機構を通じて統合することにより、段落レベルのQAペair生成を向上させるニューラル質問生成モデル、CorefNQGを提案する。このモデルはSQuADで強いベースラインを上回り、Wikipediaから126万件を超える高品質な質問-回答ペairを生成した。これらのペアは研究利用のため公開されている。

ABSTRACT

We study the task of generating from Wikipedia articles question-answer pairs that cover content beyond a single sentence. We propose a neural network approach that incorporates coreference knowledge via a novel gating mechanism. Compared to models that only take into account sentence-level information (Heilman and Smith, 2010; Du et al., 2017; Zhou et al., 2017), we find that the linguistic knowledge introduced by the coreference representation aids question generation significantly, producing models that outperform the current state-of-the-art. We apply our system (composed of an answer span extraction system and the passage-level QG system) to the 10,000 top-ranking Wikipedia articles and create a corpus of over one million question-answer pairs. We also provide a qualitative analysis for this large-scale generated corpus from Wikipedia.

研究の動機と目的

  • 既存のニューラル質問生成モデルが単一文の文脈に依存するという限界に対処すること。これは文間のコアリファレンス依存関係を捉えるのには不十分である。
  • より長いテキストの断片におけるコアリファレンスクラスタからの言語的知識を組み込むことで、読解理解のための質問生成を改善すること。
  • スケールに応じて、非構造化されたWikipedia記事から高品質で多様性に富み、文脈的に豊かな質問-回答ペアを自動で収集すること。
  • 機械読解システムの訓練および評価に適した大規模かつ公開可能なQAコーパスを構築すること。

提案手法

  • 提案されたCorefNQGモデルは、コアリファレンスクラスタ(同じ実体を指す複数の語句のグループ)の連続的表現を統合するゲーティングアテンション機構を用いる。
  • コアリファレンスクラスタは濃密なベクトル埋め込みとして表現され、それらを用いて以前の文脈上のアテンションをゲート制御することで、関連する先行語に的を絞った注目を可能にする。
  • モデルは、アノテーションスパン予測と質問生成の両方を実行するポインタジェネレータネットワークを備えたエンコーダデコーダアーキテクチャを用いて、SQuADデータセット上でエンドツーエンドに訓練される。
  • システムは2つのモジュールから構成される:アノテーションスパン抽出モジュールと段落レベルの質問生成モジュール。両者は共同で訓練され、QAペアの品質向上を図る。
  • 単一文の文脈や全前の文脈のみを用いるベースラインと比較することで、ターゲットされたコアリファレンスに配慮した符号化の利点が示された。
  • フレームワークは10,000件の上位ランクのWikipedia記事に適用され、126万件を超える質問-回答ペアのコーパスが生成された。

実験結果

リサーチクエスチョン

  • RQ1コアリファレンスに配慮したニューラルモデリングは、単一文の文脈を超えて段落レベルの質問生成を改善できるか?
  • RQ2コアリファレンスクラスタ表現を統合することで、局所的または全文脈のみを用いるモデルと比較して、生成された質問の質と多様性はどのように変化するか?
  • RQ3Wikipediaから生成されたコーパスは、SQuADのような人間がアノテートしたQAデータセットの言語的・事実的特性とどの程度一致するか?
  • RQ4Wikipediaの合成データから学習したニューラル質問生成システムは、下流の読解理解モデルの効果的な訓練を可能にするコーパスを生成できるか?

主な発見

  • CorefNQGは、SQuADデータセットにおけるすべての自動評価指標(正確一致とF1)で、単一文ベースラインおよび全文脈ベースラインを顕著に上回った。
  • コアリファレンス解決を要する質問において、CorefNQGとベースラインモデルとの性能差が特に大きかった。これは、モデルが文間依存関係を効果的に処理できることを示している。
  • 人間による評価でも、文法的正しさや回答との関連性を含め、すべての指標でベースラインモデルよりも統計的に有意に優れたスコアを達成した。
  • 生成されたコーパスには1,259,691件の質問-回答ペアが含まれており、質問タイプの分布はSQuADと類似しているが、「何が」や「何だったか」系の質問の割合が高かった。
  • 生成コーパスで微調整された最先端の読解理解モデル(DocReader)は、開発セットで82.33%の正確一致と88.20%のF1を達成した。これはコーパスが訓練に適しているが、SQuADよりわずかに難易度が高かったことを示している。
  • 合成コーパスで学習したモデルは、元のSQuAD開発セットでは性能が著しく低かった(正確一致45.2%)。これは生成データが人為的データよりも自然さに欠けたり、複雑さが増している可能性を示しており、規模と品質のトレードオフが浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。