Skip to main content
QUICK REVIEW

[論文レビュー] Automated Feedback in Math Education: A Comparative Analysis of LLMs for Open-Ended Responses

Sami Baral, Eamon Worden|arXiv (Cornell University)|Oct 29, 2024
Educational Assessment and Pedagogy被引用数 4
ひとこと要約

本研究では、オープンエンドな数学問題における自動採点とフィードバック生成のための3つのモデル——微調整済みMistralベースのGOAT、SBERT-Canberra、ゼロショットGPT-4——を評価した。GOATはスコアリングの正確性においてSBERT-Canberraを上回ったが、GPT-4は人間の評価者に好まれる、より高品質で詳細なフィードバックを生成した。これは、LLMベースの教育システムにおいて、採点の正確性とフィードバックの質の間にはトレードオフがあることを示している。

ABSTRACT

The effectiveness of feedback in enhancing learning outcomes is well documented within Educational Data Mining (EDM). Various prior research has explored methodologies to enhance the effectiveness of feedback. Recent developments in Large Language Models (LLMs) have extended their utility in enhancing automated feedback systems. This study aims to explore the potential of LLMs in facilitating automated feedback in math education. We examine the effectiveness of LLMs in evaluating student responses by comparing 3 different models: Llama, SBERT-Canberra, and GPT4 model. The evaluation requires the model to provide both a quantitative score and qualitative feedback on the student's responses to open-ended math problems. We employ Mistral, a version of Llama catered to math, and fine-tune this model for evaluating student responses by leveraging a dataset of student responses and teacher-written feedback for middle-school math problems. A similar approach was taken for training the SBERT model as well, while the GPT4 model used a zero-shot learning approach. We evaluate the model's performance in scoring accuracy and the quality of feedback by utilizing judgments from 2 teachers. The teachers utilized a shared rubric in assessing the accuracy and relevance of the generated feedback. We conduct both quantitative and qualitative analyses of the model performance. By offering a detailed comparison of these methods, this study aims to further the ongoing development of automated feedback systems and outlines potential future directions for leveraging generative LLMs to create more personalized learning experiences.

研究の動機と目的

  • オープンエンドな数学問題における、正確なスコアと意味のあるフィードバックを生成するための微調整済みLLMの有効性を評価すること。
  • 微調整済みMistralベースのモデル(GOAT)とSBERT-Canberra、ゼロショットGPT-4の自動採点およびフィードバック生成における性能を比較すること。
  • 教育経験を持つ人間の評価者による、フィードバックの質、関連性、建設性の観点から、3つのモデルの好みを評価すること。
  • 教師が採点した回答のばらつきを鑑み、トレーニングデータの質と一貫性がモデル性能に与える影響を調査すること。
  • 現在の自動フィードバックシステムの限界を特定し、今後のパーソナライズ性と信頼性の向上に向けた指針を示すこと。

提案手法

  • 中学校の数学問題における学生の回答と、それに付随する教師によるスコアとフィードバックのデータセットを用いて、MistralベースのLLM(GOAT)を微調整した。
  • 同じデータセットを用いて、SBERT-Canberraモデルを訓練し、応答評価のための意味的類似度を活用することで、自動採点のベースラインとしての役割を果たした。
  • GPT-4には微調整を施さず、ゼロショットのプロンプティング戦略を適用し、スコアリングとフィードバック生成のための詳細なルーブリックを提示した。
  • 2名の経験豊富な教師が使用した共通のルーブリックを用いて、盲検かつ比較的なアセスメントを通じて、採点の正確性とフィードバックの質を評価した。
  • スコア予測の定量的分析と、人間の評価者によるフィードバック内容の定性的分析を実施した。
  • 過去の研究から得られた教師の採点の一貫性データを活用し、性能のばらつきを文脈づけ、モデルのトレーニングにおける制限要因を明らかにした。

実験結果

リサーチクエスチョン

  • RQ1微調整済みGOATモデルは、オープンエンドな学生の回答に対する教師のスコアを、SBERT-Canberraと比較してどの程度正確に予測できるか?
  • RQ2ゼロショットGPT-4モデルは、オープンエンドな数学問題における自動採点タスクにおいて、微調整済みGOATモデルと比較してどのように異なるか?
  • RQ3フィードバックの質、関連性、建設性の観点から、人間の評価者(教育経験あり)が好むのは、SBERT-Canberra、GOAT、GPT-4のうちどれか?
  • RQ4教師のフィードバックが不一致または低品質である場合、そのようなトレーニングデータの質が、微調整済みGOATモデルの性能にどの程度影響を及えるか?
  • RQ5人間の評価者が採点やフィードバックにおいて一貫性がない場合、そのばらつきが自動フィードバックシステムの評価およびキャリブレーションにどのように影響を及えるか?

主な発見

  • GOATは、SBERT-Canberraが見逃した教師採点のパターンを捉えることができ、採点の正確性で上回った。
  • 人間の評価者による評価では、GPT-4が生成したフィードバックは、GOATおよびSBERT-Canberraのそれらよりも顕著に質が高く、詳細かつ役立っていると評価された。
  • GOATが生成したフィードバックは、訓練データの品質に強く依存しており、低品質、曖昧、やる気を失わせるようなメッセージも同様に再現していた。これは、モデルが教師の不完全な例から学習していることを示している。
  • 人間の評価者によるフィードバックの評価には顕著なばらつきが見られ、上位の教師でも、ランダムな一致を上回る一致性は73%にとどまり、人間の採点における主観性が顕著に現れた。
  • 本研究では、教師のフィードバックがしばしば公表されたルーブリックと一致しないことが判明した。多くの教師が、メンタルモデルや文脈的要因に依存しており、これにより自動フィードバックの整合性を図るのが困難であることがわかった。
  • 高い採点性能を示したにもかかわらず、GOATのフィードバック品質は、訓練データの質に制限を受けており、モデルの性能はデータの質と多様性によって制約されていることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。