Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Educational Question Generation with Pre-trained Language Models

Sahan Bulathwela, Hamze Muse|arXiv (Cornell University)|May 13, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、科学的テキスト上で大規模言語モデルをさらに事前学習し、科学分野の質問データセットで微調整することで、質問の質を向上させるスケーラブルな教育的質問生成モデルEduQGを提案する。このアプローチは、最先端のベースラインを顕著に上回り、ドメイン特化した事前学習と微調整が、AIが生成する質問の文語的流暢さと教育的関連性を向上させることを示している。

ABSTRACT

The automatic generation of educational questions will play a key role in scaling online education, enabling self-assessment at scale when a global population is manoeuvring their personalised learning journeys. We develop extit{EduQG}, a novel educational question generation model built by adapting a large language model. Our extensive experiments demonstrate that extit{EduQG} can produce superior educational questions by further pre-training and fine-tuning a pre-trained language model on the scientific text and science question data.

研究の動機と目的

  • オープン教育リソースやMOOCにおいて、スケーラブルで高品質な教育的質問が不足しているという問題に対処する。
  • 事前学習された言語モデルを科学的および教育的ドメインに適応させることで、AIが生成する教育的質問の質を向上させる。
  • 科学的コーパスでの事前学習と質問-回答データセットでの微調整が、教育的QG(質問生成)に与える影響を調査する。
  • ドメイン特化したPLMの適応によって、計算コストを低く抑えながら人間と似た質の質問を生成できることを示す。
  • テクノロジー強化学習におけるスケーラブルでパーソナライズされた評価ツールの基盤を提供する。

提案手法

  • 教育的質問生成のベースとして、T5に基づく事前学習済み言語モデルを採用する。
  • S2ORCの科学的要約の大規模コーパス上でモデルをさらに事前学習し、ドメイン特化した言語理解を強化する。
  • 13,679件の科学試験問題からなるSciQデータセットでモデルを微調整し、質問生成の質を向上させる。
  • 自動評価指標(BLEU、ROUGE、METEOR、F1、パープレキシティ、多様性)と人的評価を用いて質問の質を評価する。
  • 提案モデルの性能を、SQuAD 1.1で微調整された最先端のLeafモデルと比較する。
  • 事前学習データサイズの変化がモデル性能に与える影響を評価し、データ効率性を検証する。
Figure 1: Methodology for training and evaluating the baseline Leaf model (blue), novel EduQG Small (green) and EduQG Large (yellow) models (and their $\cdot\ +$ counterparts), introducing additional pre-training and fine-tuning steps (green dashed boxes) to address RQ 2,3 and 4.
Figure 1: Methodology for training and evaluating the baseline Leaf model (blue), novel EduQG Small (green) and EduQG Large (yellow) models (and their $\cdot\ +$ counterparts), introducing additional pre-training and fine-tuning steps (green dashed boxes) to address RQ 2,3 and 4.

実験結果

リサーチクエスチョン

  • RQ1ドメイン特化データで適応された事前学習言語モデルは、人間が生成する質問に類似した教育的質問を生成できるか?
  • RQ2一般の事前学習と比較して、科学的テキストでの事前学習は教育的質問生成の質を向上させるか?
  • RQ3事前学習データセットのサイズは、質問生成モデルの性能にどのように影響するか?
  • RQ4ドメイン特化の質問データセットでの微調整は、高品質な教育的質問の生成能力をさらに向上させるか?

主な発見

  • 科学的要約で言語モデルを事前学習することで、一般の事前学習と比較して生成された質問の文語的流暢さと言語的妥当性が顕著に向上した。
  • 提案モデルは自動評価指標において、特にROUGEとF1スコアで最先端のLeafモデルを上回り、基準となる質問との意味的整合性が優れていることが示された。
  • 事前学習データのサイズを増やすことで、質問生成の質に測定可能な改善が見られ、データスケール効果が明確に確認された。
  • SciQデータセットでの微調整により、モデルのコンテンツ特化型でカリキュラムに整合した質問の生成能力がさらに向上し、特に科学分野において顕著であった。
  • モデルは文語的に妥当で人間らしい質問を生成しており、教育現場における実用的導入の可能性が非常に高いことが示唆された。
  • 人的評価は今後の重要なステップであると特定された。現在の結果は自動評価指標とラベル付きデータセットに依存しており、AI生成と人間生成の質問を直接比較する点で、明確なギャップが存在する。
Figure 2: The distribution of (i) BLEU 1, (ii) F1 and (iii) Perplexity Score between the Leaf and EduQG models.
Figure 2: The distribution of (i) BLEU 1, (ii) F1 and (iii) Perplexity Score between the Leaf and EduQG models.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。