Skip to main content
QUICK REVIEW

[论文解读] Zero Shot Learning for Code Education: Rubric Sampling with Deep Learning Inference

Mike Wu, Milan Mosse|arXiv (Cornell University)|Sep 5, 2018
Adversarial Robustness in Machine Learning参考文献 22被引用 5
一句话总结

该论文提出了一种用于编程教育的零样本反馈系统,采用“评分表采样”(rubric sampling)——一种人机协同方法,通过获取专家对程序-误解对(p(x,y))的先验知识,实现在无历史数据的情况下进行深度学习推理(p(y|x))。该方法在反馈预测中达到人类水平的准确率,F1分数是基线方法的两倍,并支持反馈归因、时间追踪及合成数据集生成。

ABSTRACT

In modern computer science education, massive open online courses (MOOCs) log thousands of hours of data about how students solve coding challenges. Being so rich in data, these platforms have garnered the interest of the machine learning community, with many new algorithms attempting to autonomously provide feedback to help future students learn. But what about those first hundred thousand students? In most educational contexts (i.e. classrooms), assignments do not have enough historical data for supervised learning. In this paper, we introduce a human-in-the-loop "rubric sampling" approach to tackle the "zero shot" feedback challenge. We are able to provide autonomous feedback for the first students working on an introductory programming assignment with accuracy that substantially outperforms data-hungry algorithms and approaches human level fidelity. Rubric sampling requires minimal teacher effort, can associate feedback with specific parts of a student's solution and can articulate a student's misconceptions in the language of the instructor. Deep learning inference enables rubric sampling to further improve as more assignment specific student data is acquired. We demonstrate our results on a novel dataset from Code.org, the world's largest programming education platform.

研究动机与目标

  • 解决在缺乏历史学生数据的情况下,大规模编程教育中提供高质量反馈的挑战。
  • 克服监督学习在低数据场景下的局限性,即标注成本过高且不可行。
  • 开发一种方法,使在新编程作业中首次学习的学生无需先验示例,也能获得准确且可解释的反馈。
  • 实现反馈对特定代码段的归因,并支持对学生误解的纵向追踪。
  • 构建一个可扩展、数据高效的框架,通过使用深度生成模型,随着更多作业特定数据的积累而持续改进。

提出的方法

  • 使用‘评分表采样’方法,通过让专家为给定的误解生成可能的程序,来获取程序-误解联合分布 p(x,y) 的专家先验,其中 x 为学生程序,y 为其误解。
  • 利用深度生成模型(MVAE)通过插值合成数据(来自评分表采样)与未标注的真实学生数据,学习学生程序的真实分布。
  • 对未标注数据应用 log-Zipf 变换,防止模型陷入对高频程序的过拟合,确保对罕见、边缘情况解决方案的更好覆盖。
  • 在评分表采样生成的合成程序与真实学生程序的混合数据上训练 MVAE,以提升对经验数据分布的拟合度。
  • 使用训练好的 MVAE 对新出现的、未见过的学生程序执行推理 p(y|x),实现零样本反馈预测。
  • 采用进化策略自动学习评分表采样在缺乏专家知识时的最优参数(θ),提升鲁棒性与性能。

实验结果

研究问题

  • RQ1在无任何历史学生数据的情况下,零样本反馈系统能否实现与人类相当的准确率,以识别学生误解?
  • RQ2评分表采样在捕捉学生程序分布方面有多有效,尤其是在罕见但有意义的错误长尾部分?
  • RQ3深度生成模型(MVAE)在结合评分表生成的合成数据与真实未标注学生数据时,能在多大程度上提升反馈准确率?
  • RQ4系统能否将反馈归因于特定代码段,并支持学生学习过程的纵向追踪?
  • RQ5在低数据场景下,评分表采样与数据密集型的最先进方法相比,性能如何?

主要发现

  • 结合深度学习推理的评分表采样方法,其 F1 分数达到基线的两倍,零样本反馈预测接近人类水平准确率。
  • 该方法即使在零历史示例下,也优于对数据需求高的最先进算法,展现出对未见作业的强大泛化能力。
  • 在评分表采样数据与真实学生数据混合数据上训练的 MVAE,对真实学生程序分布(D_unlabeled)的覆盖显著优于基于 PCFG 的合成模型。
  • log-Zipf 变换有效防止了模型因记忆最常见程序而发生崩溃,确保对罕见、易错解决方案的更好覆盖。
  • 评分表采样平均仅需 19.4 分钟即可由新手完成,而助教标注 800 个程序需 24.9 小时,凸显其高效性。
  • 用于学习评分表参数(θ)的进化策略在某些情况下优于人工选择的参数,缩小了性能差距,甚至在特定任务中超越了专家选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。