[論文レビュー] Evaluating ChatGPT's Decimal Skills and Feedback Generation in a Digital Learning Game
本研究では、ChatGPTがデジタル学習ゲームの文脈で小数の算術問題を解く能力、学生の自己説明を評価し、フィードバックを生成する能力を評価する。5,000件以上の『Decimal Point』ゲームからの学生の回答を用いて、ChatGPTは概念的問題では優れたパフォーマンスを示し、高品質なフィードバックを生成したが、小数の位値や数直線の問題では苦戦し、学生の回答の正しさを正しく評価できた割合は75%にとどまった。
While open-ended self-explanations have been shown to promote robust learning in multiple studies, they pose significant challenges to automated grading and feedback in technology-enhanced learning, due to the unconstrained nature of the students' input. Our work investigates whether recent advances in Large Language Models, and in particular ChatGPT, can address this issue. Using decimal exercises and student data from a prior study of the learning game Decimal Point, with more than 5,000 open-ended self-explanation responses, we investigate ChatGPT's capability in (1) solving the in-game exercises, (2) determining the correctness of students' answers, and (3) providing meaningful feedback to incorrect answers. Our results showed that ChatGPT can respond well to conceptual questions, but struggled with decimal place values and number line problems. In addition, it was able to accurately assess the correctness of 75% of the students' answers and generated generally high-quality feedback, similar to human instructors. We conclude with a discussion of ChatGPT's strengths and weaknesses and suggest several venues for extending its use cases in digital teaching and learning.
研究の動機と目的
- 大規模言語モデル(LLM)であるChatGPTが、デジタル学習環境における開かれた形式の学生の自己説明を効果的に評価できるかどうかを評価すること。
- 特に位値や数直線を含む小数の算術問題におけるChatGPTの正答率を調査すること。
- 誤った学生の回答に対してChatGPTが生成するフィードバックの質と正確性を評価すること。
- 技術支援型学習環境における人間の指導者との比較を通じて、ChatGPTのフィードバックの質を評価すること。
- 数学教育における自動形式的評価にLLM(例:ChatGPT)を用いる際の強みと限界を特定すること。
提案手法
- 『Decimal Point』デジタル学習ゲームを用いて得られた5,000件以上の開かれた形式の自己説明の回答を含むデータセットを活用した。
- 各学生の回答を、関連する小数の問題と共にChatGPTに提示し、正誤の判断とフィードバックの生成を実施した。
- ChatGPTの問題解決の正確性を、正解とされる基準値(正解基準)との比較によって評価した。
- 人間がアノテートした正誤ラベルを用いて、ChatGPTが正しくない回答を正しく検出できるかの正確性を測定した。
- フィードバックの質について、明確さ、的確さ、教育的価値の観点から、人間の指導者とのフィードバックを定量的・定性的に比較分析した。
- 問題を分類(例:概念的、位値、数直線)し、問題タイプごとのパフォーマンスの違いを評価した。
実験結果
リサーチクエスチョン
- RQ1ChatGPTは、特に位値や数直線表現を含む小数の算術問題を正確に解くことができるか?
- RQ2ChatGPTは、小数の算数における学生が提供する開かれた形式の自己説明の正誤をどれほど正確に判断できるか?
- RQ3誤った学生の回答に対して、ChatGPTが生成するフィードバックの質は、人間の指導者との比較でどの程度高いか?
- RQ4ChatGPTが最も苦戦する小数の問題の種類は何か。その理由は何か?
- RQ5ChatGPTは、技術支援型学習環境において人間の採点の代替手段として、どの程度スケーラブルに活用できるか?
主な発見
- ChatGPTは、学生の回答の正誤を75%の割合で正しく評価した。これは、開かれた形式の数学的説明の自動採点において優れたパフォーマンスを示している。
- ChatGPTは、小数の比較や等価性の理解といった概念的問題において、顕著な優れたパフォーマンスを示した。
- モデルは、小数の位値や数直線の表現を含む問題において、顕著な誤りを示し、特に推論と評価の面で深刻な問題を抱えていた。
- 人間の評価者によって、ChatGPTが生成したフィードバックは高品質と評価された。明確さ、的確さ、教育的関連性の面で、人間の指導者からのフィードバックと同等の水準であった。
- 高品質なフィードバックを提供できたものの、ChatGPTのパフォーマンスは問題タイプによって一貫性に欠け、分野特有の限界が浮き彫りになった。
- 本研究は、LLM(例:ChatGPT)が教育ゲームにおける自動フィードバック生成に有効であることを確認したが、特定の数学的コンテンツ分野では慎重な検証が必要であると示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。