[论文解读] ChEDDAR: Student-ChatGPT Dialogue in EFL Writing Education
本论文介绍了ChEDDAR,这是一个大规模、纵向的英语作为第二语言(EFL)写作教育中学生与ChatGPT对话的数据集,记录了212名大学生在一个学期内的作文修改过程、意图、满意度以及编辑历史。该研究建立了意图识别和满意度估计的基线模型,为人工智能在语言教育中的伦理化整合提供了基础工具。
The integration of generative AI in education is expanding, yet empirical analyses of large-scale, real-world interactions between students and AI systems still remain limited. In this study, we present ChEDDAR, ChatGPT & EFL Learner's Dialogue Dataset As Revising an essay, which is collected from a semester-long longitudinal experiment involving 212 college students enrolled in English as Foreign Langauge (EFL) writing courses. The students were asked to revise their essays through dialogues with ChatGPT. ChEDDAR includes a conversation log, utterance-level essay edit history, self-rated satisfaction, and students' intent, in addition to session-level pre-and-post surveys documenting their objectives and overall experiences. We analyze students' usage patterns and perceptions regarding generative AI with respect to their intent and satisfaction. As a foundational step, we establish baseline results for two pivotal tasks in task-oriented dialogue systems within educational contexts: intent detection and satisfaction estimation. We finally suggest further research to refine the integration of generative AI into education settings, outlining potential scenarios utilizing ChEDDAR. ChEDDAR is publicly available at https://github.com/zeunie/ChEDDAR.
研究动机与目标
- 解决在英语作为第二语言(EFL)写作情境中,学生与生成式人工智能互动方面缺乏大规模、真实世界纵向研究的问题。
- 分析学生在使用ChatGPT修改作文时的使用模式、意图及满意度水平。
- 在面向任务的教育对话系统中,建立意图检测与满意度估计的基线模型。
- 提供一个公开可用的数据集,以支持未来在语言教育中人类-人工智能互动的研究。
提出的方法
- 收集了212名EFL学生在一个学期写作课程中的对话日志、作文编辑历史、自评满意度及意图标注。
- 使用RECIPE平台将ChatGPT整合到作文修改过程中,实现结构化的师生-AI互动。
- 对学生话语进行了14种子类别的意图标注,包括语言使用请求、修改请求、评价请求、信息获取及内容生成等。
- 开发并评估了两个子任务的基线模型:基于五级李克特量表的意图检测与满意度估计。
- 针对每个任务采用五种不同的提示工程变体,以激发模型在训练和评估中的一致响应。
- 公开发布ChEDDAR数据集,以支持可复现性及人工智能融合教育领域的进一步研究。
实验结果
研究问题
- RQ1在为期一学期的课程中,EFL学习者在使用ChatGPT修改作文时,其主要使用模式和互动意图是什么?
- RQ2学生的自评满意度水平如何与他们的陈述意图及对话上下文相关联?
- RQ3基线模型在AI辅助写作任务中,能在多大程度上检测学生对话意图并估计其满意度?
- RQ4基于真实世界纵向数据,将生成式人工智能整合到EFL写作教育中面临的主要挑战与机遇是什么?
主要发现
- 最常见的学生意图是“语言使用请求”(16.00%),其次是“回答”(21.01%)和“陈述”(2.93%),表明学生在反馈互动和自我表达方面参与度较高。
- 学生最常请求语法、词汇、拼写和标点符号方面的反馈,凸显语言准确性在EFL写作中的核心地位。
- “回答”意图的分布最高(21.01%),表明学生频繁回应AI的提示,反映出其在对话中的积极参与。
- 数据集显示,学生常使用ChatGPT进行语言层面的优化,也用于更高阶的修改,如连贯性与统一性评估。
- 意图检测与满意度估计的基线模型取得了可测量的性能表现,为未来教育人工智能中的自然语言处理模型奠定了基础。
- 本研究识别出现有数据集中的显著空白:此前无研究捕捉真实世界、纵向的人机对话数据,因此ChEDDAR成为开创性资源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。