Skip to main content
QUICK REVIEW

[论文解读] LLM-as-a-tutor in EFL Writing Education: Focusing on Evaluation of Student-LLM Interaction

Jieun Han, Haneul Yoo|arXiv (Cornell University)|Oct 8, 2023
Online Learning and Analytics被引用 4
一句话总结

本文提出FABRIC,一种通过大型语言模型(LLM)生成基于评分量规的评分(内容、组织、语言)和详细、有帮助的反馈,以增强英语作为第二语言(EFL)写作教学的流水线。该方法结合了一个新的真实世界数据集(DREsS)、一种基于污染的数据增强策略(CASE),以及一种新颖的作文思维链提示方法(EssayCoT),在反馈有用性和模型性能方面显著优于基线模型。

ABSTRACT

In the context of English as a Foreign Language (EFL) writing education, LLM-as-a-tutor can assist students by providing real-time feedback on their essays. However, challenges arise in assessing LLM-as-a-tutor due to differing standards between educational and general use cases. To bridge this gap, we integrate pedagogical principles to assess student-LLM interaction. First, we explore how LLMs can function as English tutors, providing effective essay feedback tailored to students. Second, we propose three metrics to evaluate LLM-as-a-tutor specifically designed for EFL writing education, emphasizing pedagogical aspects. In this process, EFL experts evaluate the feedback from LLM-as-a-tutor regarding quality and characteristics. On the other hand, EFL learners assess their learning outcomes from interaction with LLM-as-a-tutor. This approach lays the groundwork for developing LLMs-as-a-tutor tailored to the needs of EFL learners, advancing the effectiveness of writing education in this context.

研究动机与目标

  • 解决EFL写作教学中自动化作文评分(AES)缺乏标准化、基于评分量规的数据集的问题。
  • 通过一种新颖的数据增强策略(CASE)提高基于评分量规的AES模型的准确性,该策略引入可控错误。
  • 开发一种提示方法(EssayCoT),通过利用预测的评分量规分数来引导LLM生成更具体、更有帮助的反馈。
  • 在真实的EFL写作课堂中评估端到端流水线,同时评估模型性能和用户满意度。

提出的方法

  • FABRIC是一个三部分的流水线:DREsS(一个包含1,782篇EFL学生作文的真实世界数据集,由专家对内容、组织和语言进行评分),CASE(基于污染的数据增强,通过在高质量作文中引入合理的句子级错误来生成合成作文,以提高模型泛化能力),以及EssayCoT(一种提示策略,利用AES模型预测的评分量规分数作为思维链,引导LLM生成比标准提示更精准、更连贯的反馈)。
  • DREsS源自真实的EFL学生作文,包含专家标注的基于评分量规的分数,构成了基于评分量规的AES的标准化基准。
  • CASE通过在高质量作文中引入合理的句子级错误,生成合成训练数据,创建了3.9K篇内容、15.7K篇组织和0.9K篇语言的合成样本,以增强模型的鲁棒性。
  • EssayCoT利用AES模型预测的评分量规分数作为思维链,引导LLM生成比标准提示更具体、更连贯的反馈。
  • AES模型在DREsS上微调,并通过CASE增强,其二次加权 kappa(QWK)得分相比基线提高了26.37%。
  • 反馈通过专家评估和学生部署进行评估,该流水线已集成到一个作文编辑平台中,用于真实世界测试。
Figure 1: Overview of the pipeline. Rubric-based AES data (DREsS) is used to train AES model, which is enhanced by CASE to more accurately predict rubric-based scores. EssayCoT leverages these scores for essay feedback generation. FABRIC’s final outputs, scores and feedback, are used for EFL writing
Figure 1: Overview of the pipeline. Rubric-based AES data (DREsS) is used to train AES model, which is enhanced by CASE to more accurately predict rubric-based scores. EssayCoT leverages these scores for essay feedback generation. FABRIC’s final outputs, scores and feedback, are used for EFL writing

实验结果

研究问题

  • RQ1一个标准化的、由专家标注的基于评分量规的数据集(DREsS)是否能提高EFL写作教学中自动化作文评分的可靠性和一致性?
  • RQ2基于污染的数据增强(CASE)是否显著提升基于评分量规的AES模型性能,相比在现有数据集上进行基线训练?
  • RQ3一种利用预测评分量规分数的思维链提示策略(EssayCoT)是否能生成比标准提示方法更具体、更有帮助且更受英语教育专家青睐的反馈?
  • RQ4学生在真实世界的EFL写作课堂环境中,如何感知并评价AI生成的评分和反馈?

主要发现

  • DREsS数据集包含1,782篇真实的EFL学生作文,其内容、组织和语言的评分由专家标注,为基于评分量规的AES提供了可靠的基准。
  • CASE数据增强策略使基线模型的二次加权kappa(QWK)得分提高了26.37%,显著提升了基于评分量规评分的准确性。
  • 使用EssayCoT提示生成的反馈被13位英语教育专家评为显著更具体、更有帮助且更受青睐,优于标准提示方法。
  • 在33名EFL学生的实际部署中,生成的评分和反馈获得了平均7分制中的6分,表明用户接受度高。
  • 该流水线在增强数据集上的QWK得分为约0.6,表明其在基于评分量规的评分中表现强劲。
  • 专家评估确认,EssayCoT生成的反馈比标准提示生成的反馈更具针对性、可操作性,并更符合教学目标。
Figure 2: Prompt for EssayCoT
Figure 2: Prompt for EssayCoT

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。