[论文解读] Bridging the Novice-Expert Gap via Models of Decision-Making: A Case Study on Remediating Math Mistakes
本文提出 ReMath 基准,将专家数学家教的决策过程分解为三项任务:错误类型推断、补救策略选择和响应生成。在大语言模型(LLM)上的评估表明,提供错误类型和策略信息可使响应质量相比基线提升 75%,但模型仍未能达到专家教师水平,凸显了在辅导中开展人机协作的必要性。
Scaling high-quality tutoring remains a major challenge in education. Due to growing demand, many platforms employ novice tutors who, unlike experienced educators, struggle to address student mistakes and thus fail to seize prime learning opportunities. Our work explores the potential of large language models (LLMs) to close the novice-expert knowledge gap in remediating math mistakes. We contribute Bridge, a method that uses cognitive task analysis to translate an expert's latent thought process into a decision-making model for remediation. This involves an expert identifying (A) the student's error, (B) a remediation strategy, and (C) their intention before generating a response. We construct a dataset of 700 real tutoring conversations, annotated by experts with their decisions. We evaluate state-of-the-art LLMs on our dataset and find that the expert's decision-making model is critical for LLMs to close the gap: responses from GPT4 with expert decisions (e.g., "simplify the problem") are +76% more preferred than without. Additionally, context-sensitive decisions are critical to closing pedagogical gaps: random decisions decrease GPT4's response quality by -97% than expert decisions. Our work shows the potential of embedding expert thought processes in LLM generations to enhance their capability to bridge novice-expert knowledge gaps. Our dataset and code can be found at: \url{https://github.com/rosewang2008/bridge}.
研究动机与目标
- 通过为新手辅导者提供 AI 辅助,解决高质量数学辅导的可扩展性挑战。
- 识别当前大语言模型在有效补救学生数学错误方面,特别是在教学推理能力上的关键差距。
- 构建一个结构化框架,以建模专家在错误补救中的决策过程,从而提升 AI 辅导支持能力。
- 评估大语言模型在真实世界辅导场景中与专家教师相比的表现,重点关注响应质量和教学敏感性。
- 证明向大语言模型提供错误类型和策略信息可显著提升其补救响应质量,尽管尚未达到专家水平。
提出的方法
- 与经验丰富的数学教师共同开发 ReMath,将补救过程分解为三项独立任务:错误类型推断(任务 A)、策略选择(任务 B)和响应生成(任务 C)。
- 从 Title I 学校收集了小学一年级至五年级的数学辅导互动数据集,每个样本由两名专家教师标注错误类型和策略。
- 使用自动化指标和人工评估,对当前最先进的指令微调和对话大语言模型(如 GPT-4、Flan-T5、GODEL)在 ReMath 基准上的表现进行评估。
- 采用分层提示策略:先提示错误类型和策略,再结合两者生成最终响应,以评估结构化引导的影响。
- 使用自动化指标(ROUGE、BLEU、Self-BLEU、熵)和人工标注(偏好度、实用性、关怀度、机器人感)评估响应质量。
- 在四种条件下比较模型输出:无约束、仅提供错误类型(e)、仅提供策略(z)、以及同时提供两者(e,z),以隔离结构化输入的影响。

实验结果
研究问题
- RQ1大语言模型在多大程度上能超越原始新手辅导者的响应,在补救学生数学错误方面表现更优?
- RQ2向大语言模型提供错误类型和补救策略信息,对其响应质量有何影响?
- RQ3大语言模型生成的响应在教学品质、同理心和准确性方面,与专家教师响应相比如何?
- RQ4结构化提示(错误类型 + 策略)在提升模型在辅导任务中的表现方面发挥什么作用?
- RQ5当前的大语言模型能否独立实现专家水平的数学错误补救质量,还是必须依赖人机协同?
主要发现
- 大语言模型在补救质量上始终优于原始新手辅导者,GPT-4 在完整(e,z)条件下的人工偏好得分达到 0.95。
- 向模型同时提供错误类型和策略信息,可使其响应质量相比无约束生成提升 75%,该结果基于人工偏好度评估。
- 即使在提供完整上下文(错误类型和策略)的情况下,表现最佳的模型响应(GPT-4)仍未能达到专家教师水平,后者的人工偏好得分为 1.26。
- 引入错误类型和策略显著提升了响应的连贯性和教学相关性,减少了幻觉现象,并增强了与预期学习目标的一致性。
- 人工评估显示,缺乏结构化输入的模型常生成实用性较低、关怀度较低且更像机器的响应,GPT-4 在无约束设置下的‘关怀度’维度得分为 -0.04。
- 表现最佳的模型(GPT-4 with e,z)的 ROUGE-L 得分为 0.16,BLEU 得分为 0.02,表明其流畅性和相关性中等,但仍低于专家教师的 ROUGE-L 得分 0.91。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。