Skip to main content
QUICK REVIEW

[论文解读] Authoring Worked Examples for Java Programming with Human-AI Collaboration

Mohammad Hassany, Peter Brusilovsky|arXiv (Cornell University)|Dec 4, 2023
Software Engineering Research被引用 4
一句话总结

本文提出了一种人机协作的代码撰写系统,利用大型语言模型(如ChatGPT)自动为Java示例代码生成逐行解释,教师可随后进行编辑。用户研究表明,53.93%的参与者认为AI生成的解释在完整度上优于或等同于专家解释,证明了在编程教育中采用AI辅助示例撰写的可行性与高质量。

ABSTRACT

Worked examples (solutions to typical programming problems presented as a source code in a certain language and are used to explain the topics from a programming class) are among the most popular types of learning content in programming classes. Most approaches and tools for presenting these examples to students are based on line-by-line explanations of the example code. However, instructors rarely have time to provide line-by-line explanations for a large number of examples typically used in a programming class. In this paper, we explore and assess a human-AI collaboration approach to authoring worked examples for Java programming. We introduce an authoring system for creating Java worked examples that generates a starting version of code explanations and presents it to the instructor to edit if necessary. We also present a study that assesses the quality of explanations created with this approach.

研究动机与目标

  • 为解决编程教育中的撰写瓶颈问题,即教师缺乏时间针对代码示例生成逐行详细解释。
  • 探究大型语言模型(LLMs)是否能够为Java代码示例生成高质量、具有教学意义的解释。
  • 通过TA和学生参与的用户研究,评估AI生成解释与专家撰写解释在质量上的差异。
  • 评估人机协作在创建可交互、带解释的编程示例方面的可行性与有效性,以供教育使用。
  • 为未来作者工具的设计提供依据,支持教师高效生成高质量、可交互的学习内容。

提出的方法

  • 开发了一套撰写系统,输入为Java代码示例及其问题描述,随后利用预训练的大型语言模型(如ChatGPT)生成逐行解释。
  • 系统将AI生成的解释呈现给教师进行审阅与编辑,从而在撰写过程中实现人机协作。
  • 系统支持将示例导出为可重用格式,以便集成到现有的示例探索工具(如WebEx或PCEX)中。
  • 开展了包含15名TA和学生的用户研究,使用3分制量表比较AI生成解释与专家撰写解释在完整度与质量上的差异。
  • 解释的评估采用3分制量表:'AI更优'、'专家更优'或'两者相同',评分结果在参与者间进行汇总。
  • 研究使用单一固定提示词处理所有示例,以评估其泛化能力,尽管未来工作可探索针对不同难度的提示词。

实验结果

研究问题

  • RQ1LLMs能否为Java示例生成被人类评估者认为在教学上充分且准确的逐行代码解释?
  • RQ2在完整度与清晰度方面,AI生成的解释与专家撰写解释相比质量如何?
  • RQ3在人机协作撰写工作流中,教师与助教对AI生成解释的感知价值如何?
  • RQ4评估者在多大程度上更偏好AI生成的解释而非专家撰写的解释?影响这一偏好的因素有哪些?
  • RQ5提示词与用户界面的设计应如何支持教师有效编辑和优化AI生成的解释?

主要发现

  • 53.93%的评估者认为AI生成的解释在完整度上优于或等同于专家解释,表明其感知质量较高。
  • 平均而言,AI生成解释在3分制完整度量表上得分为1.867(0 = 两者相同,1 = 专家更优,2 = AI更优),而专家解释得分为1.400,显示AI输出在统计上更受青睐。
  • 学生在51.11%的案例中认为AI解释更优或同等,而TA和作者的偏好更高,分别达到58.15%和57.78%。
  • 尽管整体反馈积极,仍有6.96%的评估者认为AI解释不完整,而14.07%的专家解释被评定为不完整,表明仍有改进空间。
  • 研究发现,专家与AI有时会选择跳过解释某些代码行,但该决策过程未被评估,提示未来需研究何时应解释、何时应跳过。
  • 本研究样本量较小(15名参与者),示例数量有限(八个),因此结果应谨慎解读,未来需更大规模研究以实现泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。