Skip to main content
QUICK REVIEW

[论文解读] Automated Distractor and Feedback Generation for Math Multiple-choice Questions via In-context Learning

Hunter McNichols, Wanyong Feng|arXiv (Cornell University)|Aug 7, 2023
Educational Technology and Assessment被引用 6
一句话总结

本文提出一种基于大语言模型(LLMs)的上下文学习方法,用于自动生成数学多选题中合理的干扰项和富有信息量的反馈信息。尽管在无参考指标上表现良好,但该方法仍面临大语言模型误解指令或复制答案等问题,凸显了当前大语言模型在教育反馈生成方面的能力局限。

ABSTRACT

Multiple-choice questions (MCQs) are ubiquitous in almost all levels of education since they are easy to administer, grade, and are a reliable form of assessment. An important aspect of MCQs is the distractors, i.e., incorrect options that are designed to target specific misconceptions or insufficient knowledge among students. To date, the task of crafting high-quality distractors has largely remained a labor-intensive process for teachers and learning content designers, which has limited scalability. In this work, we explore the task of automated distractor and corresponding feedback message generation in math MCQs using large language models. We establish a formulation of these two tasks and propose a simple, in-context learning-based solution. Moreover, we propose generative AI-based metrics for evaluating the quality of the feedback messages. We conduct extensive experiments on these tasks using a real-world MCQ dataset. Our findings suggest that there is a lot of room for improvement in automated distractor and feedback generation; based on these findings, we outline several directions for future work.

研究动机与目标

  • 为解决手动构建高质量数学多选题干扰项与反馈信息的劳动密集型问题。
  • 探索利用大语言模型(LLMs)在数学多选题中实现干扰项与反馈信息自动生成的可行性。
  • 开发并评估基于生成式大语言模型的新型无参考指标,用于评估反馈质量,减少对参考答案相似度指标的依赖。
  • 识别当前大语言模型在生成教育反馈时的行为局限,如复制答案或误解反馈指令。
  • 通过分析多种提示策略与评估方法的性能,为未来自动化多选题生成研究提供基线参考。

提出的方法

  • 采用少样本上下文学习,基于句子嵌入计算的语义相似度,从训练集中选择与目标问题最相似的上下文示例。
  • 将干扰项生成建模为条件生成任务:给定题干和正确答案,生成与常见误解一致的合理错误选项。
  • 将反馈生成建模为条件任务:给定题干和特定干扰项,生成能解释错误并引导学生得出正确答案的反馈信息。
  • 提出两种新型无参考评估指标——Adj. Pred 和 Dist. Pred——利用生成式大语言模型判断反馈的有用性与信息量,而无需依赖真实参考答案。
  • 同时使用基于参考的指标(如 BLEU、ROUGE)与新提出的无参考指标,评估不同提示方法下的反馈质量。
  • 基于包含学生答题统计数据的真实数学多选题数据集,开展定性与定量分析,以评估方法性能及错误模式。
Figure 1: Different parts of math MCQs illustrated with an example.
Figure 1: Different parts of math MCQs illustrated with an example.

实验结果

研究问题

  • RQ1基于大语言模型的上下文学习能否有效生成反映学生常见误解的合理干扰项?
  • RQ2大语言模型能否在不复制正确答案或干扰项的前提下,生成既富有信息量又具帮助性的反馈?
  • RQ3与标准基于参考的指标相比,基于大语言模型的无参考指标在评估反馈质量时表现如何?是否能减少对真实参考答案风格的偏差?
  • RQ4大语言模型在反馈生成中的主要失败模式是什么?例如误解指令或生成无用内容,这些如何影响评估结果?
  • RQ5不同提示策略(如零样本、基于kNN的少样本、基于随机示例的少样本)在基于参考与无参考评估指标上的性能表现如何比较?

主要发现

  • 基于kNN的上下文学习方法(kNN^one)在无参考指标上优于其他提示策略,表明其更准确地捕捉了高质量反馈的风格与结构。
  • 零样本提示在基于参考的指标上得分最高,可能是因为其倾向于模仿真实反馈的风格,但常在反馈中包含正确答案或干扰项,从而降低了教育价值。
  • 无参考指标在不同方法间的性能差异远小于基于参考的指标,表明后者更偏向于风格相似性而非实际帮助性,存在明显偏差。
  • 真实反馈在无参考指标上优于所有生成反馈,但差距小于预期,表明尽管存在局限,大语言模型生成的反馈仍具备相当的实用性。
  • 误判(假阴性)常见于大语言模型误解反馈指令或忽略上下文(如当题目将选项视为整体集合时);而假阳性则出现在大语言模型独立解题但反馈无用的情况下。
  • 本研究揭示,即使是最先进的大语言模型(如 GPT-4)在指令遵循一致性与错误针对性反馈生成方面仍存在困难,表明需要改进提示工程或进行微调。
Figure 2: Overview of distractor generation with a math MCQ on “compound percentage decrease”.
Figure 2: Overview of distractor generation with a math MCQ on “compound percentage decrease”.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。