Skip to main content
QUICK REVIEW

[論文レビュー] Question Generation for Reading Comprehension Assessment by Modeling How and What to Ask

Bilal Ghanem, Lauren Lutz Coleman|arXiv (Cornell University)|Apr 6, 2022
Topic Modeling被引用数 4
ひとこと要約

本論文では、一般の質問生成(How to Ask)で事前学習し、その後、的を絞った読解力の訓練(What to Ask)に微調整する二段階の質問生成モデルであるHTA-WTAを提案する。本研究では、推論的および記述的質問を含む9つの物語ベースの読解力スキル(SBRCS)を有する新しいデータセットを構築し、HTA-WTAが強力なベースラインを上回ることを示している。特に、学習データの10%しか利用しない少データ設定(few-shot)においても、正解の監視なしに高品質でスキル特化型の質問を生成できる。

ABSTRACT

Reading is integral to everyday life, and yet learning to read is a struggle for many young learners. During lessons, teachers can use comprehension questions to increase engagement, test reading skills, and improve retention. Historically such questions were written by skilled teachers, but recently language models have been used to generate comprehension questions. However, many existing Question Generation (QG) systems focus on generating literal questions from the text, and have no way to control the type of the generated question. In this paper, we study QG for reading comprehension where inferential questions are critical and extractive techniques cannot be used. We propose a two-step model (HTA-WTA) that takes advantage of previous datasets, and can generate questions for a specific targeted comprehension skill. We propose a new reading comprehension dataset that contains questions annotated with story-based reading comprehension skills (SBRCS), allowing for a more complete reader assessment. Across several experiments, our results show that HTA-WTA outperforms multiple strong baselines on this new dataset. We show that the HTA-WTA model tests for strong SCRS by asking deep inferential questions.

研究の動機と目的

  • 読解力の質問生成において、制御可能でスキル特化型の生成が不足している問題に取り組むこと。特に推論的質問に焦点を当てる。
  • 記述的および推論的質問を含む、物語ベースの読解力スキル(SBRCS)の包括的で新しいデータセットを構築すること。
  • 一般化性能とスキル特化型の質問品質を向上させる二段階の質問生成モデル(HTA-WTA)を開発すること。
  • 実世界のデータ不足を模倣する低リソース(少データ)設定におけるモデルの性能を評価すること。
  • 正解の監視なしに、教育プラットフォーム向けに自動的かつ高品質な質問生成を可能にすること。

提案手法

  • HTA-WTAモデルは二段階の学習プロセスを採用する:まず一般の質問生成データセット(How to Ask)で事前学習し、その後、スキル特化型データセット(What to Ask)で微調整する。
  • 既存のQGデータセットからの転移学習を活用することで、一般化性能を向上させ、データ要件を低減する。
  • 生成される質問の読解スキルタイプを制御するために、スキル名トークンを入力プロンプトに挿入する。
  • 正解の監視なしに、入力として本文とスキルラベルのみを用いて、エンドツーエンドで学習する。
  • シーケンス・トゥ・シーケンスのトランスフォーマー・アーキテクチャを用い、物語ベースの本文とスキルラベルが付与された質問の新規に収集されたデータセットで微調整する。
  • 10%のデータのみを各スキルごとに学習させるために、ストラティファイドサンプリングを用いて少データ学習を模擬する。

実験結果

リサーチクエスチョン

  • RQ1正解の監視なしに、特定の読解力スキルを的確に狙った質問を生成できる二段階の質問生成モデルは、本当に有効なのか?
  • RQ2多様で多スキルな読解力データセットにおいて、HTA-WTAモデルは強力なベースラインと比較してどの程度の性能を示すのか?
  • RQ3HTA-WTAモデルは、データセットのわずかな部分(例:10%)でのみ微調整された場合、どの程度一般化できるのか?
  • RQ4スキル名トークンの導入により、モデルの特定の読解スキルに適合した質問生成能力が向上するのか?
  • RQ5本研究で提案されたモデルは、記述的質問よりも難しい推論的質問を高品質に生成できるのか?

主な発見

  • HTA-WTAは、新規に構築されたSBRCSデータセットにおいて、複数の強力なベースラインを上回り、スキル特化型の質問生成において優れた性能を示している。
  • 少データ設定(10%の学習データ)において、BLEURTスコアが33.21に達し、大多数のベースラインを上回り、一部のモデルで全データ学習を行ったものでさえも上回った。
  • 予測および比喩的言語という低リソーススキルにおいて、F1スコアが1.0(完全一致)に達した。これは、特に推論的質問タイプにおいて強い一般化性能を示している。
  • スキル名トークンの使用により、代表が不足しているスキルにおいても性能が著しく向上した。これは、質問タイプの明確な区別と制御が可能であることを示している。
  • データ量の増加に伴い性能が段階的に向上したが、10%から30%へのデータ量増加に伴うわずかな低下が観察された。これは、データスパarsity効果に関する先行研究と整合的である。
  • 正解の監視なしに、高品質な推論的質問を効果的に生成できた。これは、実世界の教育的応用における実用性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。