[论文解读] Can an AI-tool grade assignments in an introductory physics course?
本研究探讨了使用 GPT-4 辅助的工作流程在评分手写物理问题解答中的应用,通过模拟 OCR 转换为 LaTeX 并结合基于 AI 的反馈。尽管 GPT-4 能够提供合理且具有形成性意义的反馈,但其在高风险总结性评估中的可靠性不足,因此最适合用于初步筛选,并标记复杂解题路径以供人工复核。
Problem solving is an integral part of any physics curriculum, and most physics instructors would likely agree that the associated learner competencies are best assessed by considering the solution path: not only the final solution matters, but also how the learner arrived there. Unfortunately, providing meaningful feedback on written derivations is much more labor and resource intensive than only grading the outcome: currently, the latter can be done by computer, while the former involves handwritten solutions that need to be graded by humans. This exploratory study proposes an AI-assisted workflow for grading written physics-problem solutions, and it evaluates the viability of the actual grading step using GPT-4. It is found that the AI-tool is capable of providing feedback that can be helpful in formative assessment scenarios, but that for summative scenarios, particularly those that are high-stakes, it should only be used for an initial round of grading that sorts and flags solution approaches.
研究动机与目标
- 调查 GPT-4 是否能够对 handwritten 物理问题解答提供有意义的反馈。
- 评估将 OCR 和大语言模型(LLM)集成到入门级物理课程中的 AI 辅助评分工作流程的可行性。
- 确定 AI 评分在形成性评估与总结性评估情境下的适用性。
- 识别当前大语言模型在高可靠性评估解题路径与推导过程方面的局限性。
提出的方法
- 本研究使用 GPT-4 对通过提示重复生成的 25 个独特手写风格物理解答进行评分。
- 解答在 OCR 处理后被模拟为 LaTeX 文档,但由于 API 访问限制,未实际测试 OCR 转换。
- 进行了多次独立评分轮次,以评估一致性并检测反馈的差异。
- 对反馈进行了分析,评估其合理性、完整性以及与既定问题解决评分标准的一致性。
- 工作流程整合了扫描、OCR 到 LaTeX 的转换以及 AI 评分,同时具备对标记案例进行人工仲裁的潜力。
- 该方法专为离线纸质考试设计,以维护考试的完整性。
实验结果
研究问题
- RQ1GPT-4 能否对 handwritten 物理解答提供既合理又适用于形成性评估的反馈?
- RQ2GPT-4 在对同一解答进行多次独立评分轮次时,其评分是否具有一致性?
- RQ3GPT-4 的反馈在多大程度上与物理教育中的既定问题解决评分标准保持一致?
- RQ4在入门级物理课程中,使用 GPT-4 进行高风险总结性评估存在哪些局限性?
- RQ5AI 评分能否有效识别出非标准或偏离常规的解题路径,以供后续人工复核?
主要发现
- GPT-4 为物理解答生成了合理的叙述性反馈,显示出其在形成性评估中的潜力。
- AI 的反馈在多次评分轮次中表现出不一致性,表明其对同一解答的评估存在变异性。
- GPT-4 经常未能检测或正确评估非标准或有缺陷的解题路径,尤其是在偏离常规方法时。
- 尽管系统的反馈通常合理,但其可靠性不足以满足高风险总结性评估的要求。
- GPT-4 最适合用于初步筛选阶段,即标记出复杂或偏离常规的解答以供人工复核,而非承担完整的总结性评分任务。
- 本研究证实,当前的大语言模型(如 GPT-4)尚不足以在高风险情境下替代人工评分,尤其是在解题路径对评估至关重要的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。