[论文解读] Using Large Language Models to Provide Explanatory Feedback to Human Tutors
本文提出利用大型语言模型(LLMs)结合命名实体识别(NER),在在线培训会话期间向人类导师提供实时、解释性反馈。通过将导师回复分类为‘基于努力’(例如,表扬坚持)或‘基于结果’(例如,表扬正确答案)的表扬,系统生成针对性的、模板化的反馈。其在识别有效表扬方面的F1得分为0.811,表明该方法在通过自动化、上下文感知反馈提升导师培训方面具有强大潜力。
Research demonstrates learners engaging in the process of producing explanations to support their reasoning, can have a positive impact on learning. However, providing learners real-time explanatory feedback often presents challenges related to classification accuracy, particularly in domain-specific environments, containing situationally complex and nuanced responses. We present two approaches for supplying tutors real-time feedback within an online lesson on how to give students effective praise. This work-in-progress demonstrates considerable accuracy in binary classification for corrective feedback of effective, or effort-based (F1 score = 0.811), and ineffective, or outcome-based (F1 score = 0.350), praise responses. More notably, we introduce progress towards an enhanced approach of providing explanatory feedback using large language model-facilitated named entity recognition, which can provide tutors feedback, not only while engaging in lessons, but can potentially suggest real-time tutor moves. Future work involves leveraging large language models for data augmentation to improve accuracy, while also developing an explanatory feedback interface.
研究动机与目标
- 为解决在在线培训会话期间向新手导师提供实时、准确反馈的挑战。
- 通过提供解释性反馈,支持如过程聚焦或基于努力的表扬等有效表扬策略,从而提升导师培训效果。
- 探索利用LLMs与NER自动化反馈生成,减少对人工评估的依赖。
- 通过即时、个性化的反馈,解释某次回应为何有效或无效,从而增强导师的学习效果。
- 开发一种可扩展的自动化系统,用于培训非专业导师掌握社会情感与动机支持技巧。
提出的方法
- 利用大型语言模型(LLMs)对导师回复执行命名实体识别(NER),识别关键表扬类型,如基于努力、基于结果和基于个人的表扬。
- 采用基于模板的反馈系统,将识别出的命名实体(NEs)映射到预定义的解释性反馈信息。
- 使用NER标记后的回复,将导师回复分类为二元类别:有效(基于努力)或无效(基于结果)表扬。
- 生成如“说[插入努力]是过程聚焦表扬的一个好例子”之类的反馈,以引导导师做出更优回应。
- 对预测应用置信度阈值,当模型置信度较低时使用模糊化反馈(例如,“可能”)以维持系统可信度。
- 探索数据增强技术,包括同义词替换和GPT生成的训练样本,以提升在低资源环境下的性能。
实验结果
研究问题
- RQ1RQ1:我们能否应用二元分类方法,将导师回复标记为有效或无效,以提供纠正性反馈?
- RQ2RQ2:LLM支持的NER如何通过识别导师回复的关键组成部分,增强解释性反馈?
- RQ3RQ3:在导师回复数据中常见的低资源和类别不平衡数据集上,如何提升NER性能?
- RQ4RQ4:该反馈系统能否在“有效表扬”之外的其他教学课程中实现泛化?
主要发现
- 系统在分类基于努力(有效)表扬回复方面取得了0.811的F1得分,表明其在识别理想教学行为方面表现优异。
- 系统在分类基于结果(无效)表扬回复方面取得了0.350的F1得分,凸显了在检测不理想表扬类型方面的挑战。
- 观察到部分正确和真正例预测,表明传统F1得分可能无法完全反映模型在复杂反馈情境下的实际效用。
- 模型的置信度水平被证明对系统可信度至关重要,因此设计了针对低置信度预测的模糊化反馈响应。
- 正在探索使用LLM生成示例和同义词替换进行数据增强,以提升低资源环境下的NER性能。
- 未来工作将研究AUC最大化技术,以更好地处理NER任务中的类别不平衡问题,特别是考虑到超过70%的标注为'O'(无实体)标签。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。