[论文解读] Distractor generation for multiple-choice questions with predictive prompting and large language models
本文提出 Dynamic-Demo-ChatGPT,一种通过使用大型语言模型(LLMs)的检索增强提示策略,提升多项选择题(MCQs)干扰项生成质量的方法。通过动态地从题库中检索相关题目作为上下文示例,该方法显著提升了生成干扰项的质量与可靠性,实现 53% 的高质量干扰项,同时将无意义输出降低至 16%,优于零样本和少样本 LLM 基线模型。
Large Language Models (LLMs) such as ChatGPT have demonstrated remarkable performance across various tasks and have garnered significant attention from both researchers and practitioners. However, in an educational context, we still observe a performance gap in generating distractors -- i.e., plausible yet incorrect answers -- with LLMs for multiple-choice questions (MCQs). In this study, we propose a strategy for guiding LLMs such as ChatGPT, in generating relevant distractors by prompting them with question items automatically retrieved from a question bank as well-chosen in-context examples. We evaluate our LLM-based solutions using a quantitative assessment on an existing test set, as well as through quality annotations by human experts, i.e., teachers. We found that on average 53% of the generated distractors presented to the teachers were rated as high-quality, i.e., suitable for immediate use as is, outperforming the state-of-the-art model. We also show the gains of our approach 1 in generating high-quality distractors by comparing it with a zero-shot ChatGPT and a few-shot ChatGPT prompted with static examples.
研究动机与目标
- 为解决在教育场景中生成高质量、合理干扰项的挑战,其中干扰项对评估有效性至关重要。
- 探究大型语言模型(LLMs)如 ChatGPT 是否能在减少无意义或无关干扰项方面超越传统基于排序的模型。
- 评估使用动态检索的上下文示例与静态示例相比,在引导 LLM 提升干扰项质量与可靠性方面的效果。
- 开发一种结合本地排序模型与 LLM 的混合方法,以增强生成干扰项的质量与可信度,适用于实际教育应用。
提出的方法
- 该方法采用两阶段流程:首先,使用本地检索模型根据语义相似度从题库中对目标题目进行排序。
- 其次,将前 k 个检索到的题目作为上下文示例,通过预测性提示策略输入至大型语言模型(ChatGPT)以生成干扰项。
- 提示策略基于相关性动态选择上下文示例,确保 LLM 接收与目标题目语义恰当的范例。
- 该方法与零样本提示(无示例)、使用静态示例的少样本提示,以及先前的 SOTA 排序模型(DQ-SIM)进行对比。
- 由人类专家(教师)对生成的干扰项进行质量(高质量 vs. 低质量)与相关性(无意义 vs. 合理)评估,指标包括 GDR@10(优质干扰项率)与 NDR@10(无意义干扰项率)。
- 通过 1000 次自助抽样法评估统计显著性,以比较不同配置下模型的性能。
实验结果
研究问题
- RQ1RQ1:与基于排序的模型相比,ChatGPT 是否能为教育用多项选择题生成高质量干扰项?
- RQ2RQ2:在多大程度上可以信赖 ChatGPT 生成的干扰项?其可信度应如何衡量?
- RQ3RQ3:是否可以通过将基于排序的模型与 LLM 结合,提升干扰项生成能力?
主要发现
- Dynamic-Demo-ChatGPT 模型在 GDR@10 上达到 46.7%,显著优于 DQ-SIM 模型(44.6%)与 Zero-ChatGPT 基线。
- Dynamic-Demo-ChatGPT 模型将 NDR@10 降低至 15.5%,相比 DQ-SIM 模型报告的 50.1% 有显著改善。
- 平均而言,53% 的 Dynamic-Demo-ChatGPT 生成的干扰项被专家教师评为高质量,表明其可立即用于评估。
- 与静态示例基线相比,动态检索上下文示例在高质量干扰项生成方面实现了统计显著提升(p < 0.01)。
- 该模型的无意义干扰项率为 16%,相比先前的 SOTA 模型有显著改进,增强了教师对系统的信任。
- 将本地排序模型与 LLM 结合的混合方法(Dynamic-Demo-ChatGPT)显著优于零样本与少样本提示策略,证实了该混合方法的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。