Skip to main content
QUICK REVIEW

[論文レビュー] Question Generation from Paragraphs: A Tale of Two Hierarchical Models

Vishwajeet Kumar, Raktim Chaki|arXiv (Cornell University)|Nov 8, 2019
Topic Modeling参考文献 19被引用数 4
ひとこと要約

本稿では、段落レベルの質問生成のための2つの新しい階層的モデルを提案する:選択的注意を備えた階層的BiLSTMと階層的Transformerアーキテクチャ。両モデルは、文内の単語と段落内の文を階層的に処理することで段落をエンコードし、注意メカニズムを活用して関連性と文の流れの自然さを向上させる。階層的Transformerは構文的・意味的正しさにおいてすべてのベースラインを上回った一方、階層的BiLSTMは最高の関連性スコアを達成し、長文の文脈における質問生成のための階層的モデリングの有効性を示した。

ABSTRACT

Automatic question generation from paragraphs is an important and challenging problem, particularly due to the long context from paragraphs. In this paper, we propose and study two hierarchical models for the task of question generation from paragraphs. Specifically, we propose (a) a novel hierarchical BiLSTM model with selective attention and (b) a novel hierarchical Transformer architecture, both of which learn hierarchical representations of paragraphs. We model a paragraph in terms of its constituent sentences, and a sentence in terms of its constituent words. While the introduction of the attention mechanism benefits the hierarchical BiLSTM model, the hierarchical Transformer, with its inherent attention and positional encoding mechanisms also performs better than flat transformer model. We conducted empirical evaluation on the widely used SQuAD and MS MARCO datasets using standard metrics. The results demonstrate the overall effectiveness of the hierarchical models over their flat counterparts. Qualitatively, our hierarchical models are able to generate fluent and relevant questions

研究の動機と目的

  • 長文の段落レベルのテキストから高品質で関連性の高い質問を生成する課題に取り組むこと。これは文レベルの質問生成と比較して、まだ十分に研究が進んでいない。
  • 段落を文の系列として、文を単語の系列としてモデル化する階層的ニューラルアーキテクチャを設計し、より効果的に長距離依存関係を捉えること。
  • 平坦なシーケンスモデルと比較して、階層的注意メカニズムが質問の関連性と文の流れの自然さをどのように向上させるかを評価すること。
  • SQuADおよびMS MARCOデータセットにおいて、自動評価指標と人的評価指標の両方で、階層的BiLSTMとTransformerモデルの性能を比較すること。

提案手法

  • 階層的BiLSTMモデル(HierSeq2Seq + AE)は、各文内の単語をBiLSTMでエンコードし、その後、別のBiLSTMで文を段落レベルの表現に変換する。単語レベルおよび文レベルの選択的注意を用いて、質問生成に重要なコンテンツに焦点を当てる。
  • 階層的Transformerモデル(HierTransSeq2Seq + AE)は、単語レベルおよび文レベルの両方で多頭注目メカニズムを用い、階層的表現を構築する。順序の情報を保持するため、位置エンコーディングを組み込む。
  • 選択的注意は、単語レベルおよび文レベルの両方で適用され、質問生成に関連する重要なトークンや文に動的に注目する。
  • モデルは、学習の安定性を高め、より自然な質問を生成するために自己符号化(AE)機構を用いる。
  • 両モデルは、エンコーダ・デコーダフレームワークに注意機構を組み込み、自動評価指標(BLEU、ROUGE)と人的評価を最適化する形で、エンドツーエンドで訓練される。
  • アーキテクチャは、SQuADおよびMS MARCOデータセットを用いて、標準的な自動評価指標と、構文、意味、関連性の人的アノテーションによる評価が行われた。

実験結果

リサーチクエスチョン

  • RQ1文を単位として、文内での単語を処理する段落の階層的モデリングは、平坦なシーケンスモデルと比較して、質問生成の質を向上させるか?
  • RQ2単語レベルおよび文レベルの選択的注意メカニズムは、階層的BiLSTMおよびTransformerモデルにおいて、生成された質問の関連性と文の流れの自然さをどのように向上させるか?
  • RQ3階層的Transformerアーキテクチャは、階層的BiLSTMと比較して、構文的・意味的に正しい質問を生成する点で優れているか?
  • RQ4階層的モデルは、段落レベルの質問生成における自動評価と人的評価のスコア格差をどの程度縮小するか?
  • RQ5階層的モデルの失敗モードは何か。それは長文の文脈モデリングと注意メカニズムとどのように関係しているか?

主な発見

  • 階層的BiLSTMモデル(HierSeq2Seq + AE)は、SQuADデータセットでBLEU2–BLEU4指標で最高のパフォーマンスを達成し、MS MARCOデータセットにおいてもすべての自動評価指標で一貫した優れた結果を示した。
  • 階層的Transformerモデル(HierTransSeq2Seq + AE)は、SQuADおよびMS MARCOデータセットの両方で、人的評価において構文的・意味的正しさの面ですべてのベースラインを上回った。SQuADでは構文スコア86、意味スコア73.33を記録した。
  • 人的評価において、階層的BiLSTMモデルはSQuADで51.33、MS MARCOで50.00の最高の関連性スコアを達成し、入力段落との関連性において他のモデルを顕著に上回った。
  • MS MARCOデータセットでは、階層的BiLSTMモデルがすべての自動評価指標で階層的Transformerモデルを上回った。これは、データセットに依存する性能差を示している。
  • 階層的モデルは、自動評価と人的評価の両方において、平坦なモデルを常に上回った。これは、長文の文脈における質問生成のための階層的表現学習が不可欠であることを示している。
  • 人的評価の結果、階層的Transformerモデルは構文について最高の評価者間一致度(kappa = 0.87)を達成し、文法的正しさについて強い合意が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。