[論文レビュー] Multiple-Choice Question Generation: Towards an Automated Assessment Framework
本稿では、フレーズ抽出や回答に特化したプロンプトに依存せずに、文脈パラグラフから質問、正解、誤り選択肢を完全に自動で生成するエンドツーエンドの複数選択肢形式の質問生成(MCQG)フレームワークを提案する。独自の評価フレームワークを導入し、文法的正しさ、回答可能性、多様性、複雑さを自動化された指標で評価する。T5ベースのMCQGにフィルタリングを適用した手法は、RACE++データセットで100%の回答可能性と66.29%の多様性を達成し、下流のMCMRCタスクでの性能向上にわずかな向上を示した。
Automated question generation is an important approach to enable personalisation of English comprehension assessment. Recently, transformer-based pretrained language models have demonstrated the ability to produce appropriate questions from a context paragraph. Typically, these systems are evaluated against a reference set of manually generated questions using n-gram based metrics, or manual qualitative assessment. Here, we focus on a fully automated multiple-choice question generation (MCQG) system where both the question and possible answers must be generated from the context paragraph. Applying n-gram based approaches is challenging for this form of system as the reference set is unlikely to capture the full range of possible questions and answer options. Conversely manual assessment scales poorly and is expensive for MCQG system development. In this work, we propose a set of performance criteria that assess different aspects of the generated multiple-choice questions of interest. These qualities include: grammatical correctness, answerability, diversity and complexity. Initial systems for each of these metrics are described, and individually evaluated on standard multiple-choice reading comprehension corpora.
研究の動機と目的
- 高エントロピーを持つ複数選択肢形式の質問生成(MCQG)システムの評価において、n-gramベースの指標の限界を是正すること。
- フレーズ抽出や回答に特化したプロンプトを明示的に使用せずに、質問、正解、誤り選択肢を完全に自動で生成するエンドツーエンドのMCQGシステムを開発すること。
- 文法的流暢さ、回答可能性、多様性、複雑さを評価する包括的な自動評価フレームワークを設計・検証すること。
- リファレンスベースの指標に依存しない、スケーラブルで信頼性が高く質的評価可能なMCQGシステムの評価を可能にすること。
- 複数選択肢形式の機械読解(MCMRC)におけるデータ拡張のためのMCQGの有効性を向上させること。
提案手法
- 入力の文脈パラグラフから完全にエンドツーエンドでMCQを生成するT5ベースのシーケンス・ツー・シーケンスモデルを用いる。
- 4つ未満の固有の選択肢を含む質問、または複数のMCMRCモデルによる予測が一貫しない質問を除外するフィルタリングパイプラインを適用する。
- 文法的正しさを、文法的流暢さの誤りを検出できる事前学習済み言語モデルを用いて測定する。
- 予測の不確実性推定値を用いて、複数の高性能なMCMRCモデルのアンサンブルから回答可能性を評価する。
- 生成された質問における質問タイプの分布のエントロピーとして多様性を定量化する。
- 質問の構造と推論の深さに基づき、分類器を教師あり学習で訓練し、複雑さスコア(易し・中・難)を割り当てる。
実験結果
リサーチクエスチョン
- RQ1完全に自動でエンドツーエンドに動作するMCQGシステムは、フレーズ抽出や回答に特化したプロンプトに依存せずに、高品質な質問、正解、妥当な誤り選択肢を生成できるか?
- RQ2文法的正しさ、回答可能性、多様性、複雑さといったMCQGシステムの指標を、信頼性があり自動的に評価する方法は何か?
- RQ3自動指標と人間による質問品質の判断との相関はどの程度高いか?
- RQ4MCQGで生成された質問は、下流のMCMRCタスクの訓練データ拡張に有効に機能するか?
- RQ5提案された評価指標はRACE++データセットを超えて一般化可能か?
主な発見
- フィルタリングを施したT5ベースのMCQGシステムは、RACE++データセットで100%の回答可能性と66.29%の多様性を達成し、妥当で多様な質問を生成する強力な性能を示した。
- 自動評価フレームワークは、リファレンスベースの指標に依存せず、文法的流暢さ、回答可能性、多様性、複雑さといった主要な品質次元を的確に捉えた。
- フィルタリングを施したMCQGデータをデータ拡張に用いることで、下流のMCMRCタスクの性能が開発セットで0.36%、評価セットで0.12%向上した。
- GPT-3で生成された質問は、多様性(51.04%)が低く、回答不能率(71.10%)が高かったため、出力品質に限界があることが示された。
- 複雑さ分類器は、易し・中・難の質問の間に明確な違いを示し、認知的負荷を評価するうえでの有効性が裏付けられた。
- 評価フレームワークは、一部の誤り選択肢が実際の正解として妥当であることが判明し、誤り選択肢の生成戦略の改善が求められることを示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。