Skip to main content
QUICK REVIEW

[論文レビュー] Improving Controllability of Educational Question Generation by Keyword Provision

Ying-Hong Chan, Ho-Lam Chung|arXiv (Cornell University)|Dec 2, 2021
Topic Modeling参考文献 14被引用数 4
ひとこと要約

本稿では、教育的質問生成(QG)における制御可能性と多様性を向上させるために、キーワード提供に基づく制御可能質問生成(CQG)フレームワーク、KPQGを提案する。ユーザーが提供するキーワードを入力に組み込むことで、的を射た構文的多様性を持つ質問生成が可能となり、DeBERTaを用いたRACEデータセット上で20.19という最先端のBLEU-4スコアを達成し、先行研究を著しく上回った。

ABSTRACT

Question Generation (QG) receives increasing research attention in NLP community. One motivation for QG is that QG significantly facilitates the preparation of educational reading practice and assessments. While the significant advancement of QG techniques was reported, current QG results are not ideal for educational reading practice assessment in terms of extit{controllability} and extit{question difficulty}. This paper reports our results toward the two issues. First, we report a state-of-the-art exam-like QG model by advancing the current best model from 11.96 to 20.19 (in terms of BLEU 4 score). Second, we propose to investigate a variant of QG setting by allowing users to provide keywords for guiding QG direction. We also present a simple but effective model toward the QG controllability task. Experiments are also performed and the results demonstrate the feasibility and potentials of improving QG diversity and controllability by the proposed keyword provision QG model.

研究の動機と目的

  • 既存の教育的QGモデルにおける制御可能性の欠如、すなわち生成された質問がユーザーの期待に沿って制御できないという問題に対処する。
  • 単純な事実系質問を超えて、より複雑で試験に似た質問へと進化させることで、生成された質問の難易度と多様性を向上させる。
  • ユーザーがキーワードを提供することで質問の方向性をガイドするという、新しいQG設定「制御可能質問生成(CQG)」を提案する。
  • 事前学習言語モデル(PLM)が教育的評価の質問生成品質を向上させる有効性を評価する。
  • キーワードガイドが構文的制御と望ましい質問タイプへの整合性向上を可能にすることを示す。

提案手法

  • 標準的な(パassage、答え)ペアに加え、パassage、答え、およびキーワードの集合を含む入力を用いる、新しいQG設定CQGを提案する。
  • 特別なトークンを用いてキーワードを入力シーケンスに統合することで、生成をガイドするシンプルで効果的なモデルKPQGを開発する。
  • 自己回帰的、マスクされたLM、またはseq2seq生成アプローチを用いて、DeBERTa、RoBERTa、BARTなどの事前学習言語モデルを微調整して質問生成に用いる。
  • キーワードを入力プロンプトに挿入する(例:[S]パassage[S]答え[S]キーワード[M])ことで、生成プロセスを条件づける。
  • RACE試験データセットから抽出されたEQG-RACEデータセットを用いてモデルを学習し、試験に似た質問を生成する。
  • 生成品質と制御可能性を評価するために、標準的なNLP指標(BLEU、ROUGE-L、METEOR)を用いる。

実験結果

リサーチクエスチョン

  • RQ1キーワードの提供は、教育的質問生成モデルの制御可能性を顕著に向上させるか?
  • RQ2ユーザー指定のキーワードを組み込むことで、生成された質問が望ましいゴールドスタンダードの質問に近づくか?
  • RQ3キーワードガイドによって、質問の種類(例:'who' と 'which')といった構文的構造の制御が可能になるか?
  • RQ4試験に似たデータセットで事前学習言語モデルを用いることで、従来手法に比べてQG品質が向上するか?
  • RQ5提案手法は、教育的評価準備における多様性と実用的有用性の両方を向上させられるか?

主な発見

  • 提案されたKPQGモデルは、EQG-RACEデータセット上で20.19という最先端のBLEU-4スコアを達成し、以前のSOTA(11.96)を大きく上回った。
  • キーワード提供によるガイドにより、ベースラインモデルよりも顕著にゴールドスタンダードの質問に近い質問を生成できた。
  • 「mars」や「Megan Smith」といったキーワードを用いることで、KPQGは意図した焦点に沿った質問を効果的に生成したが、ベースラインモデルは関連のない質問を生成した。
  • モデルは構文的制御を示した:'who' や 'which' をキーワードとして使用することで、対応する質問構造が生成され、的を射た構文的多様性が実現された。
  • 事例研究では、キーワード入力を変化させることでKPQGが多様で文脈的に適切な質問を生成できることを示し、教育者にとっての実用的有用性が向上した。
  • DeBERTaをバックボーンモデルとして用いることで最良のパフォーマンスが得られたことから、高品質な教育的QGには強力な事前学習モデルが不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。