[论文解读] Generating Situated Reflection Triggers about Alternative Solution Paths: A Case Study of Generative AI for Computer-Supported Collaborative Learning
本研究开发并评估了一种生成式AI系统,该系统在云计算机课程的协作SQL查询优化过程中提供情境化定制的反思触发提示。通过将ChatGPT与在线编程环境集成,系统生成动态、与讨论相关的提示,以增强概念性学习;然而,34名学生的试点实验显示,与基线协作相比,学习效果无显著提升,可能由于参与度较低以及实验组前测分数方差较大。
An advantage of Large Language Models (LLMs) is their contextualization capability - providing different responses based on student inputs like solution strategy or prior discussion, to potentially better engage students than standard feedback. We present a design and evaluation of a proof-of-concept LLM application to offer students dynamic and contextualized feedback. Specifically, we augment an Online Programming Exercise bot for a college-level Cloud Computing course with ChatGPT, which offers students contextualized reflection triggers during a collaborative query optimization task in database design. We demonstrate that LLMs can be used to generate highly situated reflection triggers that incorporate details of the collaborative discussion happening in context. We discuss in depth the exploration of the design space of the triggers and their correspondence with the learning objectives as well as the impact on student learning in a pilot study with 34 students.
研究动机与目标
- 设计并实现一种生成式AI系统,以在协作编程任务期间提供动态、上下文敏感的反思触发提示。
- 探索LLM如何基于实时学生讨论和代码输入,生成针对特定情境的替代解决方案路径。
- 评估AI生成的反思触发提示在计算机支持协作学习(CSCL)环境中对学生学习的影响。
- 通过利用多模态学生输入(代码与聊天)实现个性化,以弥补现有静态或通用支架的局限性。
- 识别在协作学习环境中AI生成反馈的参与度、连贯性和可读性方面的设计挑战。
提出的方法
- 将ChatGPT集成到一门大学级别云计算机课程现有的在线编程练习(OPE)机器人中。
- 设计了一套提示工程框架,基于学生输入、讨论上下文和学习目标,生成替代性代码贡献。
- 训练LLM生成反思触发提示,建议不同解决方案路径,同时引用协作讨论和代码的具体方面。
- 在一项控制实验中部署该系统,对比接受AI生成触发提示的实验组与接受标准协作支持的对照组。
- 收集前后测问卷数据,使用ANCOVA分析学习成效,以学习目标和阶段为因子,并以前测分数作为协变量以控制基线差异。
- 从学生和助教处收集定性反馈,以识别反思触发提示在可用性和参与度方面的问题。
实验结果
研究问题
- RQ1LLM能否在协作编程任务期间生成情境相关的反思触发提示,以建议替代解决方案路径?
- RQ2在协作SQL优化任务中,使用AI生成的、情境化反思触发提示如何影响学生的学习成果?
- RQ3在实时协作学习环境中部署LLM生成的反馈时,面临的主要可用性和参与度挑战是什么?
- RQ4在控制先验知识差异的前提下,AI生成的反思触发提示与标准协作支持相比,能在多大程度上提升学习效果?
- RQ5学生和助教如何评价AI生成的反思提示的相关性、清晰度和实用性?
主要发现
- 所有学习目标下,学生在前后测之间均表现出显著的学习进步,效应量较小(Cohen’s d = 0.18σ),表明活动本身具有普遍学习效果。
- 实验组的前测分数显著高于对照组,这一差异混淆了分析结果,并降低了检测处理效应的统计效能。
- 未发现学习目标、阶段与反思条件之间的三重交互作用,表明AI生成触发提示在不同学习目标上无差异化优势。
- 题项层面的分析显示,关于索引和反规范化的问题持续表现不佳(正确率低于50%),可能由于答案选项复杂且难以阅读。
- 学生和助教反映,部分反思触发提示存在混淆、与正在进行的讨论脱节,且过长导致难以有效阅读。
- 本研究识别出三大局限:参与度低、提示上下文连贯性差,以及因消息过长导致可读性差,这些问题将在未来工作中加以解决。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。