[论文解读] Distilling ChatGPT for Explainable Automated Student Answer Assessment
本文提出 AERA 框架,将 ChatGPT 的推理生成能力蒸馏到更小、更高效的语言模型中,以实现可解释的自动化学生作答评估。通过使用优化的提示模板并应用推理过程优化,该方法在 Quadratic Kappa (QWK) 上相比直接使用 ChatGPT 提升了 11% 的评分性能,同时生成的人工评估质量相当的推理过程。
Providing explainable and faithful feedback is crucial for automated student answer assessment. In this paper, we introduce a novel framework that explores using ChatGPT, a cutting-edge large language model, for the concurrent tasks of student answer scoring and rationale generation. We identify the appropriate instructions by prompting ChatGPT with different templates to collect the rationales, where inconsistent rationales are refined to align with marking standards. The refined ChatGPT outputs enable us to fine-tune a smaller language model that simultaneously assesses student answers and provides rationales. Extensive experiments on the benchmark dataset show that the proposed method improves the overall QWK score by 11% compared to ChatGPT. Furthermore, our thorough analysis and human evaluation demonstrate that the rationales generated by our proposed method are comparable to those of ChatGPT. Our approach provides a viable solution to achieve explainable automated assessment in education. Code available at https://github.com/lijiazheng99/aera.
研究动机与目标
- 开发一种框架,利用大语言模型实现可解释的自动化学生作答评估。
- 通过利用 ChatGPT 的推理能力,解决现有学生评估数据集中缺乏推理标注的问题。
- 通过生成解释评估决策的自然语言推理过程,提升模型的可解释性。
- 将 ChatGPT 的推理能力蒸馏到更小、更高效的语言模型中,以实现实际部署。
- 通过人工评估和基准对比验证生成推理过程的质量。
提出的方法
- 设计多种提示模板,以从 ChatGPT 获取学生作答的推理过程。
- 应用推理过程优化模块,修正不一致或低质量的推理,使其与评分标准对齐。
- 在优化后的推理-评分对上微调小型语言模型,以实现评分与解释生成的联合预测。
- 采用两阶段提示策略,在蒸馏前提升 ChatGPT 推理过程的一致性与忠实度。
- 通过人工评估衡量推理质量,因为目前尚无自动指标可衡量推理正确性而无需真实标签。
- 端到端训练蒸馏模型,使其同时完成评分与推理生成任务。
实验结果
研究问题
- RQ1大语言模型(如 ChatGPT)是否能在不依赖额外人工标注推理数据的前提下,为学生作答评估生成高质量推理?
- RQ2如何系统性地优化大语言模型生成的不一致或低保真度推理,使其与正式评估标准对齐?
- RQ3更小的蒸馏语言模型是否能在评分准确率和推理质量上均优于原始大模型(如 ChatGPT)?
- RQ4蒸馏模型生成的推理在清晰度、相关性和忠实度方面,与人工标注推理的匹配程度如何?
- RQ5该蒸馏框架是否能有效生成轻量化、可部署的模型,同时在可解释评估中保持高性能?
主要发现
- 所提出的 AERA 框架相比直接使用 ChatGPT,将整体 Quadratic Weighted Kappa (QWK) 得分提升了 11%。
- 蒸馏后的小型语言模型在评估性能上优于 ChatGPT,且其生成的推理在人工评估中质量与 ChatGPT 相当。
- 推理过程优化策略显著提升了 ChatGPT 生成推理与官方评分标准之间的一致性与对齐度。
- 人工评估者认为蒸馏模型生成的推理具有高度可靠性与可解释性,且在质量上与 ChatGPT 无显著差异。
- 该框架可在无需昂贵人工标注推理数据的前提下,实现高质量、可解释的自动化评估。
- 该方法表明,从像 ChatGPT 这类强大大模型中蒸馏,可获得紧凑、高效且有效的教育评估模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。