[论文解读] Performance of the Pre-Trained Large Language Model GPT-4 on Automated Short Answer Grading
本研究在未进行任何微调的情况下,评估了 GPT-4 在 SciEntsBank 和 Beetle 数据集上的自动短答案评分(ASAG)性能。GPT-4 的表现与早期手工设计的模型相当,但逊于经过特定任务微调的专用大语言模型,同时展现出强大的零样本能力,即使在没有参考答案的情况下也能正确评分。
Automated Short Answer Grading (ASAG) has been an active area of machine-learning research for over a decade. It promises to let educators grade and give feedback on free-form responses in large-enrollment courses in spite of limited availability of human graders. Over the years, carefully trained models have achieved increasingly higher levels of performance. More recently, pre-trained Large Language Models (LLMs) emerged as a commodity, and an intriguing question is how a general-purpose tool without additional training compares to specialized models. We studied the performance of GPT-4 on the standard benchmark 2-way and 3-way datasets SciEntsBank and Beetle, where in addition to the standard task of grading the alignment of the student answer with a reference answer, we also investigated withholding the reference answer. We found that overall, the performance of the pre-trained general-purpose GPT-4 LLM is comparable to hand-engineered models, but worse than pre-trained LLMs that had specialized training.
研究动机与目标
- 评估 GPT-4 在未进行任何微调的情况下于自动短答案评分(ASAG)任务中的零样本性能。
- 将 GPT-4 的 ASAG 性能与特定任务训练的专用模型在标准基准上的表现进行比较。
- 探究 GPT-4 是否能在无法访问参考答案的情况下准确评分学生答案。
- 评估使用通用大语言模型作为可扩展、自动反馈的通用解决方案在大规模课程中的可行性。
提出的方法
- 通过 OpenAI API 调用 GPT-4,使用 SemEval-2013 提供的标准化评分标准,对 SciEntsBank 和 Beetle 数据集中的学生答案进行评分。
- 采用两种提示设置:一种提供参考答案,另一种不提供,以评估零样本评分能力。
- 评分采用结构化的 CSV 输出格式,包含 'ID' 和 'correctness' 两列,将答案标记为 'correct'、'contradictory' 或 'incorrect'。
- 通过在二分类和三分类任务上的精确率、召回率和 F1 分数来评估性能。
- 本研究仅使用数据集的测试集数据,丢弃训练集数据,并由于计算成本限制,仅运行一次推理。
实验结果
研究问题
- RQ1与经过特定任务微调的专用模型相比,GPT-4 在未进行任何微调的情况下于 ASAG 任务中的表现如何?
- RQ2GPT-4 是否能在零样本设置下(即无法访问参考答案)准确评分学生答案?
- RQ3GPT-4 在不同教育领域(如通用科学,SciEntsBank;电学与电子学,Beetle)中的表现是否存在差异?
- RQ4与过去十年中基于手工设计和深度学习的 ASAG 模型相比,GPT-4 的表现如何?
主要发现
- 在提供参考答案的情况下,GPT-4 在二分类的 SciEntsBank 数据集上取得 F1 分数 0.73,在三分类的 Beetle 数据集上取得 F1 分数 0.65。
- 在无参考答案的二分类 Beetle 数据集上,GPT-4 取得 F1 分数 0.74,表明其具备强大的零样本能力。
- GPT-4 的表现与早期手工设计的模型相当,但始终低于如 BERT 和 RoBERTa 等经过微调的专用大语言模型。
- 该模型在零样本评分中表现出稳健性,即使在无参考答案的情况下也能正确识别正确和错误答案,尤其在 SciEntsBank 数据集上表现更优。
- 该模型未表现出在数据集中训练过的迹象,因为它未能识别 Johnny 和 windows 场景中的特定细节,表明不存在数据泄露。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。