Skip to main content
QUICK REVIEW

[論文レビュー] Difficulty Controllable Generation of Reading Comprehension Questions

Yifan Gao, Lidong Bing|arXiv (Cornell University)|Jul 10, 2018
Topic Modeling参考文献 27被引用数 15
ひとこと要約

本稿では、位置に敏感な埋め込みとグローバルな難易度変数を活用して、指定された難易度レベルを持つ読解問題を生成するエンドツーエンドフレームワークであるDifficulty-controllable Question Generation (DQG)を提案する。この手法は、優れた問題品質と強力な難易度制御を達成しており、人間が難易度ラベルを付与した76,000件のSQuAD問題から構成される新規データセットで検証された。

ABSTRACT

We investigate the difficulty levels of questions in reading comprehension datasets such as SQuAD, and propose a new question generation setting, named Difficulty-controllable Question Generation (DQG). Taking as input a sentence in the reading comprehension paragraph and some of its text fragments (i.e., answers) that we want to ask questions about, a DQG method needs to generate questions each of which has a given text fragment as its answer, and meanwhile the generation is under the control of specified difficulty labels---the output questions should satisfy the specified difficulty as much as possible. To solve this task, we propose an end-to-end framework to generate questions of designated difficulty levels by exploring a few important intuitions. For evaluation, we prepared the first dataset of reading comprehension questions with difficulty labels. The results show that the question generated by our framework not only have better quality under the metrics like BLEU, but also comply with the specified difficulty labels.

研究の動機と目的

  • 読解における難易度制御付きの問題生成の欠如に取り組むこと。これはNLP分野でこれまで未解決であった設定である。
  • 難易度レベルがラベル付けされた読解問題の最初の大規模データセットを構築すること。これにより、難易度制御可能なモデルの学習と評価が可能になる。
  • 特定の難易度レベルに適合した質問を生成するニューラル生成フレームワークを開発すること。同時に、高い事実的正確性と文法的正しさを維持する。
  • 入力文における近接ヒント(例:答えに近い語)とグローバル難易度信号をどのようにモデル化できるかを検討すること。これにより、望ましい難易度レベルに向けた質問生成を支援する。
  • 事前学習済み読解モデルをプロキシ指標として用いて、生成された質問の難易度を評価すること。

提案手法

  • フレームワークは、非ストップワードが答え断片からの距離を符号化する位置埋め込みを組み込んだseq2seqアーキテクチャを採用しており、難易度制御のための近接ヒントをモデル化している。
  • グローバル難易度変数を潜在表現として導入し、指定された難易度レベル(例:易しい、難しい)に応じて、全般的な質問生成プロセスを条件づける。
  • 交差エントロピー損失を用いてエンドツーエンドで学習し、生成された質問が指定された答えに集中するよう、答えに特化したデコードを実施している。
  • 既存のSQuAD問題に、言語的特徴とRCモデルの信頼度スコアの組み合わせを用いて自動的に複数の難易度レベルでラベル付けする、新しいデータ収集パイプラインを考案した。
  • 生成された質問が入力文と答え断片に基づいて関連性があり、回答可能であることを保証するため、答えに特化したアテンションメカニズムを統合している。
  • 難易度評価には、事前学習済み読解モデル(例:BERT)を用い、答えのスパンを予測し、信頼度スコアを計算することで、質問の難易度のプロキシとして使用している。

実験結果

リサーチクエスチョン

  • RQ1事実的・文法的品質を維持しつつ、難易度が制御可能なニューラル質問生成モデルを訓練できるか?
  • RQ2入力文における近接ヒント(例:答えに近い語)をどのようにモデル化できるか? これにより、質問の難易度に影響を与える。
  • RQ3同じ入力文と答えペアから、グローバル難易度変数が効果的に異なる難易度の質問を生成できるか?
  • RQ4明示的な難易度ラベルが付与された大規模かつ高品質な読解問題データセットを構築することは可能か?
  • RQ5事前学習済み読解モデルは、生成された質問の難易度を信頼できるプロキシ指標として使用できるか?

主な発見

  • 提案されたDQGフレームワークは、自動評価指標において最先端の性能を達成しており、BLEUスコアがベースライン手法と比較して最大20.79ポイント向上した。
  • 難易度制御を備えたモデル(DLPH-GDC)は、RCモデルの信頼度スコアを用いた評価で、指定された難易度レベルに最も適切に一致する質問を生成する能力を示し、他の手法を上回った。
  • 位置に敏感な埋め込みの使用により、質問の品質が顕著に向上した。QWPHバージョンは、BLEUスコアと答えの関連性の両面でAnsベースラインを上回った。
  • 同じ入力文と答えペアから、易しい質問と難しい質問を両方生成でき、易しい質問は平均的に答えの語に近い語を含む(距離が短い)傾向にあった。
  • 自動難易度ラベル付け手法により、76,000件のSQuAD問題に難易度ラベルを付与した。これにより、難易度制御可能な質問生成の最初の大規模な研究が可能になった。
  • 事例研究により、モデルがより的を射た質問を生成することが確認された。DLPH-GDCは、易しい質問ではより近くの語を多く使用し、難しい質問ではより少ない、より遠くの手がかりを使用していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。