Skip to main content
QUICK REVIEW

[论文解读] AI-enhanced Auto-correction of Programming Exercises: How Effective is GPT-3.5?

Imen Azaiz, Oliver Deckarm|arXiv (Cornell University)|Oct 24, 2023
Artificial Intelligence in Healthcare and Education参考文献 26被引用 4
一句话总结

本研究通过分析慕尼黑路德维希-马克西米利安大学(LMU Munich)的实际学生提交代码,评估了GPT-3.5在生成入门级编程作业个性化反馈方面的有效性。结果显示,GPT-3.5在73%的情况下正确识别了代码的正确性,其中59%的反馈质量较高,但其在错误定位方面偶尔出现偏差,或提出违反作业要求的修改建议。

ABSTRACT

Timely formative feedback is considered as one of the most important drivers for effective learning. Delivering timely and individualized feedback is particularly challenging in large classes in higher education. Recently Large Language Models such as GPT-3 became available to the public that showed promising results on various tasks such as code generation and code explanation. This paper investigates the potential of AI in providing personalized code correction and generating feedback. Based on existing student submissions of two different real-world assignments, the correctness of the AI-aided e-assessment as well as the characteristics such as fault localization, correctness of hints, and code style suggestions of the generated feedback are investigated. The results show that 73 % of the submissions were correctly identified as either correct or incorrect. In 59 % of these cases, GPT-3.5 also successfully generated effective and high-quality feedback. Additionally, GPT-3.5 exhibited weaknesses in its evaluation, including localization of errors that were not the actual errors, or even hallucinated errors. Implications and potential new usage scenarios are discussed.

研究动机与目标

  • 探究GPT-3.5是否能在大规模高等教育环境中有效提供个性化、高质量的编程练习反馈。
  • 评估GPT-3.5判断学生代码在功能上是否正确或错误的准确性。
  • 评估GPT-3.5生成反馈的质量与特征,包括错误定位、提示相关性、代码风格建议以及与作业要求的一致性。
  • 识别GPT-3.5在提供自动化反馈方面的优势与不足,尤其与传统电子评估系统进行对比。
  • 探讨将大语言模型整合到编程教育工作流程中的实际影响与局限,特别是在形成性评估中的应用。

提出的方法

  • 从慕尼黑路德维希-马克西米利安大学(LMU Munich)两门第一学期编程课程中收集真实的学生提交代码。
  • 通过基于提示的接口,使用一致的提示结构,将每份提交代码连同作业要求一并提交给GPT-3.5。
  • 对每份提交代码执行三次独立的GPT-3.5推理运行,以减轻响应差异,并对结果进行聚合。
  • 由两名研究人员通过反复讨论制定编码方案,对GPT-3.5的响应进行人工分类,以确保可靠性。
  • 根据正确性、错误定位、提示相关性、指令符合度以及个性化程度,评估反馈质量。
  • 将GPT-3.5的输出与真实正确性标签及作业要求进行对比,以衡量其准确性和保真度。

实验结果

研究问题

  • RQ1RQ1:GPT-3.5在判断学生提交代码正确性方面表现如何?
  • RQ2RQ2:从长度、提示质量、与作业要求的符合度、错误定位、代码修正及个性化程度等方面,如何对GPT-3.5生成的反馈进行描述?
  • RQ3RQ3:GPT-3.5在提供编程练习个性化反馈与代码修正方面,其优势与不足分别是什么?

主要发现

  • 在73%的情况下,GPT-3.5正确识别了学生提交代码的正确性,且在识别错误代码方面准确率高于识别正确代码。
  • 在正确判断正确性的59%案例中,GPT-3.5生成的反馈有效且质量较高,包括准确的错误定位和可操作的建议。
  • GPT-3.5偶尔出现错误定位偏差,例如建议修复不存在的问题,或未能检测到实际存在的错误,尤其是在字符串大小写等细微方面。
  • 该模型有时提供的反馈违反了作业要求,例如建议修改导致所需行为或输出格式发生变化。
  • GPT-3.5在处理功能逻辑正确但存在语法错误的代码时表现吃力,有时会忽略语法错误而过度关注功能逻辑。
  • 尽管存在局限,GPT-3.5在作为助教的预评估工具方面展现出潜力,可实现快速错误识别与反馈初稿生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。