[论文解读] Towards LLM-based Autograding for Short Textual Answers
本文评估了大型语言模型(LLMs)在多语言和多课程情境下用于自动化短文本答案评分的可行性,表明尽管LLMs能提供有价值的补充视角,但由于可靠性和偏见问题,目前尚不具备在无人工监督下完全自主评分的能力。研究强调LLMs有潜力协助教育工作者验证评分流程。
Grading exams is an important, labor-intensive, subjective, repetitive, and frequently challenging task. The feasibility of autograding textual responses has greatly increased thanks to the availability of large language models (LLMs) such as ChatGPT and the substantial influx of data brought about by digitalization. However, entrusting AI models with decision-making roles raises ethical considerations, mainly stemming from potential biases and issues related to generating false information. Thus, in this manuscript, we provide an evaluation of a large language model for the purpose of autograding, while also highlighting how LLMs can support educators in validating their grading procedures. Our evaluation is targeted towards automatic short textual answers grading (ASAG), spanning various languages and examinations from two distinct courses. Our findings suggest that while "out-of-the-box" LLMs provide a valuable tool to provide a complementary perspective, their readiness for independent automated grading remains a work in progress, necessitating human oversight.
研究动机与目标
- 评估LLMs在教育环境中评分短文本答案的可行性和可靠性。
- 评估LLMs在两门不同大学课程中,针对多种语言和考试类型的表现。
- 探讨LLMs如何协助教育工作者验证和审计自身的评分决策。
- 识别在自动化评分中部署LLMs时的主要风险,特别是偏见和幻觉问题。
- 为在适当人工监督下将LLMs整合到评分工作流程中,提供基于证据的建议。
提出的方法
- 作者将预训练的LLM应用于两门大学课程的短答案响应评分,涵盖多种语言。
- 通过提示工程设计,促使LLM生成与评分量规一致的稳定评估结果。
- 将LLM的评分结果与人工评分基准进行对比,以评估准确性和一致性。
- 评估包括定量指标(如与人工评分的相关性)和LLM推理过程的定性分析。
- 研究采用多阶段流程:提示设计、LLM推理、评分聚合,以及与人工评分黄金标准的对比。
- 通过LLM生成反馈的案例研究,分析偏见和幻觉等伦理问题。
实验结果
研究问题
- RQ1LLMs在多大程度上能生成与人工评分基准高度相关的评分结果,用于短文本答案?
- RQ2LLMs在不同语言和学科领域教育评估中的表现如何变化?
- RQ3LLMs在哪些方面可协助教育工作者验证或审计自身的评分决策?
- RQ4在自动化评分中使用LLMs时,主要风险(如偏见或幻觉)是什么?
- RQ5如何将LLMs整合到评分工作流程中,以支持而非取代人类评分者?
主要发现
- LLMs与人工评分结果表现出中等到高度相关性,表明其作为辅助评分工具具有潜力。
- LLMs在不同语言间表现差异显著,非英语及低资源语言的准确率较低。
- LLM偶尔会生成看似合理但错误的反馈,表明存在幻觉和偏见风险。
- 人工监督在纠正错误、确保评分结果的公平性和一致性方面始终必要。
- LLMs提供的反馈有助于教育工作者识别自身评分模式中的不一致性。
- 研究发现,未经微调或严格验证的‘开箱即用’LLMs尚不可靠,无法独立承担自动化评分任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。