[论文解读] Generative Grading: Near Human-level Accuracy for Automated Feedback on Richly Structured Problems
本论文提出生成式评分(generative grading)这一新方法,利用教师编写的概率模拟器(Idea2Text)生成合成训练数据,用于神经网络模型,从而实现在复杂结构化问题上接近人类水平的自动化反馈。该方法在基于积木的编程任务中实现超人类准确率(相较之前工作提升50%),在图形任务和文本回答任务中分别取得4倍和1.5倍的性能提升,并在真实课堂环境中将评分准确率翻倍,同时将评分时间减半。
Access to high-quality education at scale is limited by the difficulty of providing student feedback on open-ended assignments in structured domains like computer programming, graphics, and short response questions. This problem has proven to be exceptionally difficult: for humans, it requires large amounts of manual work, and for computers, until recently, achieving anything near human-level accuracy has been unattainable. In this paper, we present generative grading: a novel computational approach for providing feedback at scale that is capable of accurately grading student work and providing nuanced, interpretable feedback. Our approach uses generative descriptions of student cognition, written as probabilistic programs, to synthesise millions of labelled example solutions to a problem; we then learn to infer feedback for real student solutions based on this cognitive model. We apply our methods to three settings. In block-based coding, we achieve a 50% improvement upon the previous best results for feedback, achieving super-human accuracy. In two other widely different domains -- graphical tasks and short text answers -- we achieve major improvement over the previous state of the art by about 4x and 1.5x respectively, approaching human accuracy. In a real classroom, we ran an experiment where we used our system to augment human graders, yielding doubled grading accuracy while halving grading time.
研究动机与目标
- 解决在编程、图形设计和简短文本回答等领域的开放性、结构化作业中,大规模提供高质量、细致反馈的挑战。
- 克服传统监督学习方法在数据稀缺、标签稀疏以及教育场景中对可解释性与精确评分需求方面的局限。
- 开发一种系统,通过将学生决策过程建模为生成过程并反向推导,以模拟人类教师的评分方式,从而推断学生的思维过程。
- 构建一个可扩展、可解释且准确的反馈系统,减轻人工评分负担,同时提升评分的一致性与保真度。
- 通过最近邻分析识别导致误判的决策节点,实现对学生模拟器的自动改进。
提出的方法
- 该方法使用教师编写的Idea2Text模拟器——一种概率程序,用于建模学生决策过程,并将决策映射到最终解决方案。
- 利用智能采样技术,从这些模拟器中生成数百万条合成的、带标签的示例解决方案,以覆盖多样的学生作答模式。
- 训练深度神经网络执行推理任务:将真实学生解决方案映射回可能生成它们的决策序列。
- 推理模型采用一种新型可微分架构,以处理可变长度序列和非固定标签,实现在无需人工标注反馈的情况下端到端学习。
- 通过将模型预测与模拟器中的特定决策节点关联,实现可解释性,支持针对特定模块的反馈和错误定位。
- 系统通过识别在复杂案例中反复导致解析失败的决策节点,支持模拟器的迭代改进。
实验结果
研究问题
- RQ1基于教师编写的模拟器的生成式建模方法,能否在开放性、结构化问题的自动化反馈中实现接近人类水平的准确率?
- RQ2该方法在多选题之外的领域(如基于积木的编程、图形任务和简短文本回答)中效果如何?
- RQ3在真实教育环境中,该系统在多大程度上能减少人工评分负担,同时提升准确率与一致性?
- RQ4系统能否自动识别学生模拟器中存在缺陷的组件,并基于失败模式提出改进建议?
- RQ5与以往最先进方法相比,该方法在反馈质量与可扩展性方面表现如何?
主要发现
- 在基于积木的编程任务中,该方法相较之前最佳结果提升50%,准确率超过人类水平。
- 在图形任务中,系统相较之前最先进方法实现4倍性能提升,接近人类水平表现。
- 在简短文本回答任务中,方法相较先前工作实现1.5倍性能提升,显著缩小与人工评分准确率的差距。
- 在一次真实的CS1课堂实验中,当该系统用于辅助人工评分时,评分准确率翻倍,同时评分时间减半。
- 系统成功识别出在修改后的模拟器中导致解析失败的前6个决策节点,且所有节点在语义上均与错误类型相关。
- 该方法通过将预测结果与特定决策节点关联,实现可解释反馈,为学生推理过程提供模块化层面的洞察。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。