[论文解读] Could an Artificial-Intelligence agent pass an introductory physics course?
本研究评估了大型语言模型ChatGPT是否能够通过密歇根州立大学提供的真实课程材料,完成并及格一节标准的基于微积分的入门物理课程。尽管其解释看似合理,ChatGPT仅以1.5分(满分4.0分)的微弱优势通过,暴露出持续存在的误解、计算错误以及缺乏元认知能力,凸显了物理教育应更强调批判性思维而非机械解题。
Massive pre-trained language models have garnered attention and controversy due to their ability to generate human-like responses: attention due to their frequent indistinguishability from human-generated phraseology and narratives, and controversy due to the fact that their convincingly presented arguments and facts are frequently simply false. Just how human-like are these responses when it comes to dialogues about physics, in particular about the standard content of introductory physics courses? This study explores that question by having ChatGTP, the pre-eminent language model in 2023, work through representative assessment content of an actual calculus-based physics course and grading the responses in the same way human responses would be graded. As it turns out, ChatGPT would narrowly pass this course while exhibiting many of the preconceptions and errors of a beginning learner.
研究动机与目标
- 评估像ChatGPT这样的前沿语言模型是否能够成功完成并及格一节标准的基于微积分的入门物理课程。
- 评估ChatGPT的回答质量与准确性,与人类学生进行比较,特别是在概念理解、解题策略和计算准确性方面。
- 调查AI生成的回答是否表现出与初学者物理学习者相同的误解与错误,尤其是在推理和数值计算方面。
- 探讨AI表现对物理教育的影响,特别是对评估设计、学术诚信以及专家级认识论技能发展的意义。
- 确定像ChatGPT这样的AI工具是否削弱或重塑物理教育的目标,尤其是在培养批判性评估与元认知能力方面。
提出的方法
- 将ChatGPT用于密歇根州立大学一学期基于微积分的物理课程中的实际评估题目,包括作业、答题器问题、考试和编程练习。
- 使用与人类学生作业相同的评分标准进行评分,重点关注概念推理、数学执行过程以及单位的使用。
- 本研究使用2023年1月9日发布的ChatGPT版本,以确保所有评估结果的一致性与可重复性。
- 评估内容取自LON-CAPA平台,该平台会随机化问题参数,防止简单的模式匹配。
- 对ChatGPT的回答进行分析,评估其是否符合专家解题策略,如量纲分析、极限情况检验和一致性检查。
- 评估将AI的回答与典型初学者学生的错误进行对比,包括路径依赖误解、单位遗漏以及累积舍入误差。

实验结果
研究问题
- RQ1当使用真实课程材料进行评估时,像ChatGPT这样的大型语言模型能否成功解决并及格一节标准的基于微积分的入门物理课程?
- RQ2ChatGPT的回答在多大程度上反映出初学者物理学生典型的误解与错误?
- RQ3在概念推理、计算准确性和解题策略使用方面,ChatGPT的表现与人类学生相比如何?
- RQ4AI模型通过物理课程对教育评估、学术诚信和课程设计有何影响?
- RQ5ChatGPT在哪些方面缺乏元认知能力,这种缺陷如何影响其回答的可靠性与批判性评估?
主要发现
- ChatGPT在4.0分制的课程中最终获得1.5分的分数,勉强通过入门物理课程系列。
- 该模型表现出常见的初学者错误,例如在位移问题中未能考虑方向变化,以及在多步计算中错误地延续舍入误差。
- ChatGPT频繁在回答中遗漏单位,并且未能识别出在返程时间问题中某些变量(如速度)会相互抵消,而是依赖于数值代入的机械计算。
- 尽管其解释听起来合理,但ChatGPT在正确答案与错误或误导性信息之间以相同自信程度呈现,表明其缺乏元认知能力。
- 由于其在编程语言方面的训练,该模型在计算类练习中表现相对良好,表明AI在基于编程的物理任务中可能已超过人类学生。
- 本研究结论认为,尽管ChatGPT能够通过标准评估,但其是通过模式化推理而非深层次的概念理解实现的,这凸显了在物理教育中应优先培养批判性思维。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。