Skip to main content
QUICK REVIEW

[論文レビュー] Difficulty Controllable Question Generation for Reading Comprehension.

Yifan Gao, Jianan Wang|arXiv (Cornell University)|Jul 10, 2018
Topic Modeling被引用数 17
ひとこと要約

本稿では、回答スパンに基づいて質問の難易度を事前に予測し、その難易度に適合した質問を生成する2段階手法である難易度制御可能質問生成(Dico-QG)を提案する。この手法は、BLEUスコアで測定される質問の質を向上させるとともに、指定された難易度ラベルに準拠することを保証する。新しく作成された難易度ラベルが付与されたデータセットを用いて検証された。

ABSTRACT

Question generation aims to generate natural language questions from a range of data sources such as free text and image. In this paper, we investigate the difficulty levels of questions, and propose a new task called Difficulty Controllable Question Generation (Dico-QG). Taking as input a reading comprehension paragraph and some text fragments (i.e. answers) in the paragraph that we want to ask about, a Dico-QG method needs to generate questions each of which has a given text fragment as its answer and is associated with a difficulty label. To solve this task, we proposed a two-step approach. The first step estimates what difficulty level of question could be generated for a given answer. After that, in the generation step, the estimated difficulty is employed together with other information as input to generate a question. For evaluation, we prepared the first dataset of reading comprehension questions with difficulty labels. The results show that our approach not only generates questions of better quality under the metrics like BLEU, but also has the capability of difficulty awareness to generate questions complying with the difficulty label.

研究の動機と目的

  • 既存の読解問題生成手法における質問難易度の制御の欠如に対処すること。
  • 質問が正確であるだけでなく、特定の認知的難易度レベルに適合するように生成できることを可能にすること。
  • 質問生成の過程で難易度レベルを推定・強制する手法を開発し、教育的有用性を向上させること。
  • 読解問題の難易度ラベルが人間によって付与されたベンチマークデータセットを構築すること。
  • 難易度制御の有効性が、高品質で難易度に準拠した質問を生成する上でどのように発揮されるかを評価すること。

提案手法

  • 本手法は2段階パイプラインを採用する:まず、難易度推定モジュールが与えられた回答スパンの適切な難易度レベルを予測する。
  • 得られた難易度は、段落と回答スパンとともに生成段階での条件入力として使用される。
  • 生成モデルは、回答および予測された難易度ラベルの両方を条件として用い、ターゲット難易度に一致する質問を生成する。
  • 段落、回答、難易度ラベルを構造化された入力表現としてエンコードするため、系列対系列モデルを用いる。
  • 難易度推定モデルは、人間が付与した難易度ラベルが付与された新たに構築されたデータセットで学習される。
  • 全体のフレームワークは、交差エントロピー損失とコントラスト損失のコンponentsを含み、生成された質問と難易度ターゲットとの整合性を向上させるエンドツーエンドで学習可能である。

実験結果

リサーチクエスチョン

  • RQ1質問生成モデルは、読解パラグラフ内の与えられた回答スパンに対して、適切な難易度レベルを効果的に予測できるか?
  • RQ2指定された難易度レベルに従う際、生成された質問がどれほど高い文の流れの自然さと関連性を維持できるか?
  • RQ3難易度制御が、このような制御のないベースライン手法と比較して、生成された質問の質にどのように影響するか?
  • RQ4同じ回答スパンから質問を生成する際、モデルは異なる難易度レベル(例:易しめ、普通、難しめ)に一般化できるか?
  • RQ5BLEUのような自動評価指標は、質問の質と難易度準拠性に関する人間の判断とどれほど相関しているか?

主な発見

  • 提案されたDico-QG手法は、ベースライン手法よりも高いBLEUスコアを達成しており、生成された質問の文の自然さと関連性の向上を示している。
  • モデルは強力な難易度認識能力を示し、指定された難易度ラベルと密接に一致する質問を生成している。
  • 人間が付与した難易度ラベルが付与されたデータセットのおかげで、質問生成における難易度制御の評価が信頼性を持って可能になった。
  • 難易度推定と生成を分離する2段階アプローチは、統合学習アプローチと比較して、より良い制御性と質をもたらしている。
  • 人間評価により、生成された質問が正確であるだけでなく、ターゲット難易度に応じた適切な難易度であることも確認された。
  • 自動評価および人間評価の両方において、非制御ベースラインを上回る性能を示しており、特に難易度仕様への一貫性を保つ点で優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。