Skip to main content
QUICK REVIEW

[论文解读] Evaluating Language Models for Generating and Judging Programming Feedback

Charles Koutcheme, Nicola Dainese|arXiv (Cornell University)|Jul 5, 2024
Software Engineering Techniques and Practices被引用 4
一句话总结

本研究评估了开源大型语言模型(LLMs)在生成和评判Python作业编程反馈方面的表现,与GPT-4o等专有模型进行对比。结果表明,最先进的开源模型如Llama3-70B在反馈生成和质量评估方面表现几乎与专有模型相当,展现出在成本效益、透明度和可及性方面作为教育工具的强劲潜力。

ABSTRACT

The emergence of large language models (LLMs) has transformed research and practice across a wide range of domains. Within the computing education research (CER) domain, LLMs have garnered significant attention, particularly in the context of learning programming. Much of the work on LLMs in CER, however, has focused on applying and evaluating proprietary models. In this article, we evaluate the efficiency of open-source LLMs in generating high-quality feedback for programming assignments and judging the quality of programming feedback, contrasting the results with proprietary models. Our evaluations on a dataset of students' submissions to introductory Python programming exercises suggest that state-of-the-art open-source LLMs are nearly on par with proprietary models in both generating and assessing programming feedback. Additionally, we demonstrate the efficiency of smaller LLMs in these tasks and highlight the wide range of LLMs accessible, even for free, to educators and practitioners.

研究动机与目标

  • 评估开源LLM在导论级Python编程作业中生成反馈的质量。
  • 评估开源LLM是否能有效判断编程反馈质量,与人类专家水平相当。
  • 比较开源与专有LLM在反馈生成和评估任务中的表现。
  • 探索使用更小、免费获取的LLM在教育反馈应用中的可行性。
  • 通过倡导使用开源LLM而非专有替代方案,推动计算教育中的透明度、成本效率和数据隐私。

提出的方法

  • 使用五种最先进的开源LLM和两种专有模型(包括GPT-4o)生成错误解释和修复建议。
  • 采用自定义评分标准,通过人工评估反馈质量,重点关注完整性、可理解性和修复准确性。
  • 使用专家标注的真实标签,评估模型在判断反馈质量方面的表现。
  • 使用EasyLLM库和HuggingFace API访问模型,大多数模型的使用成本极低。
  • 通过两名标注员进行评分者间一致性检查,获得中等程度的Krippendorff’s alpha值为0.49。
  • 在多种不同规模的LLM(包括Phi-3-mini、Mistral-7B和Llama3-70B)上评估模型表现,以评估可扩展性和效率。

实验结果

研究问题

  • RQ1RQ1:在为学生编程提交内容生成高质量错误解释和修复建议方面,开源与闭源LLM的表现如何比较?
  • RQ2RQ2:开源与闭源LLM在多大程度上能准确评估编程反馈质量,与人类专家判断相比?
  • RQ3RQ3:相较于大模型,更小、可免费获取的LLM在反馈生成和判断任务中的表现如何?
  • RQ4RQ4:在教育反馈系统中,使用开源LLM与专有LLM相比,在性能、成本和数据隐私方面存在哪些权衡?

主要发现

  • 最先进的开源LLM Llama3-70B在反馈生成和判断任务中均达到与GPT-4o相当的性能。
  • 尽管计算资源有限,较小的开源模型如Phi-3-mini也表现出具有竞争力的性能,表明其在消费级设备上部署的可行性。
  • 人工标注的评分者间一致性为中等(Krippendorff’s alpha = 0.49),表明在标注一致性方面仍有改进空间。
  • 开源LLM在作为LLM裁判方面展现出强大潜力,在反馈评估中表现与GPT-4o相当,有助于实现反馈的迭代优化。
  • 研究发现,模型规模与性能之间并无直接相关性,例如Phi-3-mini等小型模型的表现超出预期。
  • 作者发布了代码、模型输出和标注数据,以支持该领域未来研究的可复现性和基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。