[论文解读] AI-assisted Automated Short Answer Grading of Handwritten University Level Mathematics Exams
本文评估了 GPT-4 在大学水平数学考试中对手写简答题的评分效果,表明其在极少提示工程的情况下可提供可靠且成本效益高的初步评分。尽管在识别手写数学表达式方面存在局限,GPT-4 在语义理解与等价性检测方面表现优异,表明其与可靠的置信度估计和改进的 OCR 流水线结合时,可作为人类评分员的潜在 AI 助手。
Effective and timely feedback in educational assessments is essential but labor-intensive, especially for complex tasks. Recent developments in automated feedback systems, ranging from deterministic response grading to the evaluation of semi-open and open-ended essays, have been facilitated by advances in machine learning. The emergence of pre-trained Large Language Models, such as GPT-4, offers promising new opportunities for efficiently processing diverse response types with minimal customization. This study evaluates the effectiveness of a pre-trained GPT-4 model in grading semi-open handwritten responses in a university-level mathematics exam. Our findings indicate that GPT-4 provides surprisingly reliable and cost-effective initial grading, subject to subsequent human verification. Future research should focus on refining grading rules and enhancing the extraction of handwritten responses to further leverage these technologies.
研究动机与目标
- 评估使用类似 GPT-4 的预训练大语言模型对大学水平数学考试中手写简答题评分的可行性。
- 研究 GPT-4 在识别数学概念等价答案方面的能力,即使答案以不同表述或符号形式呈现。
- 开发并评估一种基于概率基础的 GPT-4 评分决策置信度估计方法。
- 识别将 AI 集成到高风险学术评估中的关键挑战,特别是手写表达识别与评分规则制定方面。
- 提出一种实用的 AI 辅助评分流程,通过人机协同验证减少人工评分工作量,同时保持准确性。
提出的方法
- 使用极少提示工程的 GPT-4 对真实大学考试中六道简答题的学生作答进行评分。
- 采用两阶段工作流:首先通过 OCR(使用 Mathpix API)扫描并转录整张试卷,然后使用 LaTeX 和基于 Python 的解析方法提取答案字段。
- 采用概率理论方法估计 GPT-4 评分决策的置信度,从而识别不确定或异常的预测结果。
- 使用标准化评分标准将 GPT-4 的输出与人工评分结果进行对比,重点关注正确性与等价性检测能力。
- 根据模型行为观察与错误分析,对评分提示与规则进行迭代优化。
- 通过在提示中保持句式一致但改变表述方式,测试模型对改写表述的鲁棒性。
实验结果
研究问题
- RQ1GPT-4 是否能在极少提示定制化的情况下,可靠地评分手写简答数学题?
- RQ2GPT-4 的评分对同一数学概念的不同表述或符号形式的改写有多强的鲁棒性?
- RQ3GPT-4 的表现在多大程度上依赖于 OCR 转录输入的质量,特别是手写数学表达式的识别准确率?
- RQ4基于概率的置信度估计方法是否能有效识别不可靠或不确定的 AI 生成评分?
- RQ5在大学数学的高风险、人机协同评分中,部署 LLM 的关键挑战是什么?
主要发现
- GPT-4 在评分简答数学题方面表现出高度可靠性,即使在符号形式差异显著的情况下,也能正确识别数学等价解法。
- 该模型在评分提示的改写中表现出强鲁棒性,当句式保持不变时,性能保持一致。
- GPT-4 的表现显著受限于手写数学表达式 OCR 流水线的准确性,表明输入质量是关键瓶颈。
- 所提出的基于概率的置信度估计方法效果显著,为识别高风险评分决策提供了可行路径。
- 尽管未为此任务进行微调,GPT-4 的表现仍优于五年前的专用模型,凸显通用大语言模型在教育评估中的潜力。
- 本研究证实,LLM 可作为评分工作流中的有效 AI 助手,在结合人工验证时,既能显著减少人工工作量,又能保持评分准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。