[论文解读] Evaluating ChatGPT's Decimal Skills and Feedback Generation in a Digital Learning Game
本研究评估了ChatGPT在数字学习游戏情境下解决十进制算术问题、评估学生自解释以及生成反馈的能力。基于来自‘Decimal Point’游戏的5,000多个学生回答,ChatGPT在概念性问题上表现优异,并生成了高质量反馈,但在十进制数位值和数轴问题上表现较弱,仅正确评估了75%的学生答案。
While open-ended self-explanations have been shown to promote robust learning in multiple studies, they pose significant challenges to automated grading and feedback in technology-enhanced learning, due to the unconstrained nature of the students' input. Our work investigates whether recent advances in Large Language Models, and in particular ChatGPT, can address this issue. Using decimal exercises and student data from a prior study of the learning game Decimal Point, with more than 5,000 open-ended self-explanation responses, we investigate ChatGPT's capability in (1) solving the in-game exercises, (2) determining the correctness of students' answers, and (3) providing meaningful feedback to incorrect answers. Our results showed that ChatGPT can respond well to conceptual questions, but struggled with decimal place values and number line problems. In addition, it was able to accurately assess the correctness of 75% of the students' answers and generated generally high-quality feedback, similar to human instructors. We conclude with a discussion of ChatGPT's strengths and weaknesses and suggest several venues for extending its use cases in digital teaching and learning.
研究动机与目标
- 评估类似ChatGPT的大型语言模型是否能有效评估数字学习环境中学生开放性自解释的正确性。
- 探究ChatGPT在解决涉及数位值和数轴表示的十进制算术问题时的准确性。
- 评估ChatGPT针对学生错误回答所生成反馈的质量与正确性。
- 在技术增强学习环境中,比较ChatGPT的反馈质量与人类教师的反馈质量。
- 识别使用类似ChatGPT的大型语言模型(LLM)在数学教育中实现自动化形成性评估的优势与局限性。
提出的方法
- 使用了来自学生使用‘Decimal Point’数字学习游戏的5,000多个开放性自解释回答的数据集。
- 将每个学生回答连同对应的十进制问题一并呈现给ChatGPT,以评估其正确性并生成反馈。
- 通过将ChatGPT的回答与真实正确答案进行比较,评估其问题解决准确性。
- 使用人工标注的正确性标签,衡量ChatGPT在识别学生答案正确与否方面的准确性。
- 对反馈质量进行定性和定量分析,将其与人类教师的反馈在清晰度、具体性和教学价值方面进行比较。
- 将问题分类(如概念性、数位值、数轴等),以评估不同题型下的表现差异。
实验结果
研究问题
- RQ1ChatGPT能否准确解决涉及数位值和数轴表示的十进制算术问题?
- RQ2ChatGPT在判断学生提供的十进制数学开放性自解释的正确性方面准确度如何?
- RQ3ChatGPT为错误学生答案所生成的反馈质量,与人类教师相比如何?
- RQ4ChatGPT在哪些类型的十进制问题上表现最差,原因是什么?
- RQ5在技术增强学习环境中,ChatGPT在多大程度上可作为人类评分的可扩展替代方案?
主要发现
- ChatGPT正确评估了75%的学生回答,表明其在自动化评分开放性数学解释方面表现良好。
- ChatGPT在概念性十进制问题上表现优异,例如比较小数和理解等价性。
- 该模型在涉及十进制数位值和数轴表示的问题上表现显著不足,推理与评估中出现明显错误。
- 人类评估者对ChatGPT生成的反馈评价为高质量,其清晰度、具体性和教学相关性与人类教师的反馈相当。
- 尽管反馈质量高,ChatGPT在不同题型上的表现不一致,凸显其在特定领域存在局限性。
- 本研究证实,类似ChatGPT的大型语言模型可在教育游戏中有效用于自动化反馈生成,但需针对特定数学内容领域进行仔细验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。