[论文解读] Evaluating ChatGPT and GPT-4 for Visual Programming
本研究评估了 GPT-4 和 ChatGPT(GPT-3.5)在 Hour of Code 和 Karel 的视觉编程任务中的表现,重点考察执行轨迹、解决方案综合与任务综合能力。尽管 GPT-4 相较于 ChatGPT 有所改进,但两种模型在整合空间思维、逻辑思维与编程能力方面表现依然不佳,表明当前生成式 AI 在 K-8 教育场景中存在显著局限性。
Generative AI and large language models have the potential to drastically improve the landscape of computing education by automatically generating personalized feedback and content. Recent works have studied the capabilities of these models for different programming education scenarios; however, these works considered only text-based programming, in particular, Python programming. Consequently, they leave open the question of how well these models would perform in visual programming domains popularly used for K-8 programming education. The main research question we study is: Do state-of-the-art generative models show advanced capabilities in visual programming on par with their capabilities in text-based Python programming? In our work, we evaluate two models, ChatGPT (based on GPT-3.5) and GPT-4, in visual programming domains for various scenarios and assess performance using expert-based annotations. In particular, we base our evaluation using reference tasks from the domains of Hour of Code: Maze Challenge by Code-dot-org and Karel. Our results show that these models perform poorly and struggle to combine spatial, logical, and programming skills crucial for visual programming. These results also provide exciting directions for future work on developing techniques to improve the performance of generative models in visual programming.
研究动机与目标
- 探究最先进的生成式 AI 模型(如 GPT-4 和 ChatGPT)在视觉编程任务中的表现是否与它们在基于文本的 Python 编程中相当。
- 评估这些模型在三种关键教育场景中的能力:执行轨迹、解决方案综合与任务综合,涵盖视觉编程领域。
- 通过专家标注评估性能,并识别视觉编程中所需的多模态推理能力的差距。
- 为未来提升生成式模型在 K-8 计算教育中视觉编程能力的研究提供基础。
提出的方法
- 在三个场景中评估了两个模型——ChatGPT(GPT-3.5)和 GPT-4——在视觉编程中的表现:执行轨迹、解决方案综合与任务综合。
- 选取了两个领域中的十个参考任务:Hour of Code 的迷宫挑战(HoCMaze)和 Karel,任务在代码规模、深度和结构上具有不同复杂度。
- 采用专家标注评估输出质量,使用二元指标:LayoutCorrect、TaskSolvedByCode、TaskSolvedByEdittedCode、TaskSolvable 和 Overall。
- 为每个场景设计提示,包含输入代码和任务规范的占位符,确保评估的一致性。
- 汇总 10 个实例的结果,以百分比形式报告各项指标的性能,并由人工评估者验证输出。
- 采用宽松的可解性标准(TaskSolvable),允许轻微代码修改,以反映真实的教育场景。
实验结果
研究问题
- RQ1最先进的生成式模型(如 GPT-4 和 ChatGPT)在视觉编程中的表现是否与在基于文本的编程中相当?
- RQ2这些模型在生成视觉程序正确执行轨迹方面表现如何?
- RQ3这些模型能否为给定的视觉编程任务生成有效解决方案?
- RQ4这些模型能否基于给定的解决方案代码生成新的、可解的视觉编程任务?
主要发现
- GPT-4 在任务综合中的 Overall 得分为 20.0%,而 ChatGPT 为 10.0%,表明有可测量的改进,但整体表现仍较差。
- GPT-4 在 LayoutCorrect 上得分为 90.0%,TaskSolvable 上为 80.0%,但在 TaskSolvedByCode 上为 0.0%,表明其生成的结构正确任务无法被输入代码解决。
- 两种模型在整合空间思维、逻辑结构与编程逻辑方面均表现显著不足,尤其在复杂任务如 HoCMaze:18 和 Karel:Stairway 中。
- 模型未能生成能被输入代码正确解决的任务,两项模型在 TaskSolvedByCode 上的准确率均为 0.0%。
- GPT-4 在 LayoutCorrect(90.0% vs. 70.0%)和 TaskSolvable(80.0% vs. 50.0%)上相比 ChatGPT 显著提升,但在功能性正确性方面无改善。
- 示例表明,即使结构正确,GPT-4 生成的任务仍存在错误的墙壁位置或目标位置,导致输入代码失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。