Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the Quality of Multiple-Choice Questions Using GPT-4 and Rule-Based Methods

Steven Moore, Huy A. Nguyen|arXiv (Cornell University)|Jul 16, 2023
Software Engineering Research被引用数 7
ひとこと要約

本研究では、4つの教科領域における学生が作成した複数選択式問題(MCQ)の19の一般的な項目作成の欠陥を検出するために、ルールベース手法とGPT-4を評価した。ルールベース手法は、生成AIの誤報リスクに依存しない教育的評価において、91%の正確性を達成したのに対し、GPT-4は79%にとどまり、優れた信頼性を示した。

ABSTRACT

Multiple-choice questions with item-writing flaws can negatively impact student learning and skew analytics. These flaws are often present in student-generated questions, making it difficult to assess their quality and suitability for classroom usage. Existing methods for evaluating multiple-choice questions often focus on machine readability metrics, without considering their intended use within course materials and their pedagogical implications. In this study, we compared the performance of a rule-based method we developed to a machine-learning based method utilizing GPT-4 for the task of automatically assessing multiple-choice questions based on 19 common item-writing flaws. By analyzing 200 student-generated questions from four different subject areas, we found that the rule-based method correctly detected 91% of the flaws identified by human annotators, as compared to 79% by GPT-4. We demonstrated the effectiveness of the two methods in identifying common item-writing flaws present in the student-generated questions across different subject areas. The rule-based method can accurately and efficiently evaluate multiple-choice questions from multiple domains, outperforming GPT-4 and going beyond existing metrics that do not account for the educational use of such questions. Finally, we discuss the potential for using these automated methods to improve the quality of questions based on the identified flaws.

研究の動機と目的

  • 教育現場における質の低い複数選択式問題(MCQ)の課題、特に学生が作成した問題に対して対処すること。
  • GPT-4のような大規模言語モデル(LLM)よりも、ルールベース手法がMCQの特定の項目作成の欠陥を検出する能力に優れているかどうかを評価すること。
  • 自動化手法が、文法的・構造的読みやすさを超えて、教育的質に関連する欠陥を同定する有効性を評価すること。
  • 多様な学術分野にわたり、信頼性があり解釈可能な教育的根拠に基づいた、学生が作成したMCQの質の管理手法を提供すること。

提案手法

  • 複数選択式問題における19の事前に定義された項目作成の欠陥(例:曖昧な選択肢、二重否定、現実的でない誘導選択肢)を検出するカスタムルールベースシステムを開発した。
  • 科学、人文学、社会科学、STEMの4つの異なる教科領域から得た200件の学生が作成したMCQに、ルールベースシステムを適用した。
  • 同じ19の欠陥を検出するために、一貫した指示テンプレートを用いてGPT-4をゼロショットプロンプティング設定で使用した。
  • 人間によるアノテーションの基準(3名の専門家が各問題の欠陥を独立してラベル付け)と照合して両手法を評価した。
  • 両システムの欠陥検出精度を比較するために、正確性(precision)、再現率(recall)、F1スコアを算出した。
  • 言語的および認知的要請が異なる多様な学術分野をカバーすることで、分野間一般化の可能性を確保した。

実験結果

リサーチクエスチョン

  • RQ1ルールベース手法は、学生が作成した複数選択式問題における一般的な項目作成の欠陥を検出する際、GPT-4を上回ることができるか?
  • RQ2ルールベース手法とLLMベース手法の性能は、異なる学術分野でどのように変動するか?
  • RQ3自動化手法は、人間によるアノテーション基準とどの程度一致するか?
  • RQ4教育的評価の文脈において、ルールベース手法はLLMよりも信頼性が高く、解釈が可能な欠陥検出を提供できるか?
  • RQ5自動化された質の評価ツールは、テクノロジー強化学習環境における学生が作成したMCQの教育的妥当性を向上させることができるか?

主な発見

  • ルールベース手法は、人間アノテーターの基準に基づき、91%の正確性で項目作成の欠陥を検出できた。これはGPT-4の79%を顕著に上回った。
  • ルールベース手法は、4つの教科領域すべてで一貫した性能を示し、分野間一般化の能力が優れていることが示された。
  • GPT-4は高い偽陽性率を示し、しばしば問題のない要素を不具合と誤検出していた。これは、誤報や過剰解釈への感受性を示している。
  • ルールベースアプローチは、GPT-4よりも高い正確性と再現率を示し、人間によるアノテーション基準との整合性が高かった。
  • 本研究は、MCQにおける明確に定義された教育的質の基準に対して、ルールベースシステムがLLMよりも信頼性が高い可能性を確認した。
  • 項目作成の欠陥の自動検出は、教育技術プラットフォームにおける学生が作成した評価用アイテムの質を向上させるために効果的に利用できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。