[论文解读] Multiple-Choice Question Generation: Towards an Automated Assessment Framework
本文提出了一种完全自动化、端到端的多项选择题生成(MCQG)框架,无需依赖短语抽取或答案感知提示,即可从上下文段落中生成问题、正确答案和干扰项。该框架引入了一套新颖的评估体系,通过自动化指标评估语法正确性、可回答性、多样性与复杂度,结果表明基于T5的MCQG结合过滤机制在RACE++数据集上实现了100%的可回答性与66.29%的多样性,且在下游MCMRC任务中取得微小提升。
Automated question generation is an important approach to enable personalisation of English comprehension assessment. Recently, transformer-based pretrained language models have demonstrated the ability to produce appropriate questions from a context paragraph. Typically, these systems are evaluated against a reference set of manually generated questions using n-gram based metrics, or manual qualitative assessment. Here, we focus on a fully automated multiple-choice question generation (MCQG) system where both the question and possible answers must be generated from the context paragraph. Applying n-gram based approaches is challenging for this form of system as the reference set is unlikely to capture the full range of possible questions and answer options. Conversely manual assessment scales poorly and is expensive for MCQG system development. In this work, we propose a set of performance criteria that assess different aspects of the generated multiple-choice questions of interest. These qualities include: grammatical correctness, answerability, diversity and complexity. Initial systems for each of these metrics are described, and individually evaluated on standard multiple-choice reading comprehension corpora.
研究动机与目标
- 解决基于n-gram的评估指标在高熵多项选择题生成(MCQG)系统中评估能力有限的问题。
- 开发一种完全自动化、端到端的MCQG系统,无需显式短语抽取或答案感知提示,即可生成问题、正确答案与干扰项。
- 设计并验证一套全面的自动化评估框架,用于评估语法流畅性、可回答性、多样性和复杂度。
- 实现MCQG系统在参考基准指标之外的可扩展、可靠且高质量的评估。
- 提升MCQG在多项选择机器阅读理解(MCMRC)任务中数据增强的实效性。
提出的方法
- 使用基于T5的序列到序列模型,从输入上下文段落端到端生成完整的MCQs。
- 应用过滤流水线,剔除选项少于四个或在多个MCMRC模型集成中预测不一致的问题。
- 利用预训练语言模型检测语法流畅性错误,以衡量语法正确性。
- 通过多个高性能MCMRC模型的预测不确定性估计来评估可回答性。
- 将生成问题中问题类型的分布熵作为多样性量化指标。
- 训练一个有监督分类器,根据问题结构与推理深度分配复杂度评分(简单/中等/困难)。
实验结果
研究问题
- RQ1完全自动化、端到端的MCQG系统是否能在不依赖短语抽取或答案感知提示的前提下,生成高质量的问题、正确答案与合理干扰项?
- RQ2如何在MCQG系统中可靠且自动地评估语法正确性、可回答性、多样性和复杂度?
- RQ3自动化指标与人类对MCQG问题质量的判断之间相关性如何?
- RQ4MCQG生成的问题是否能有效用于下游MCMRC任务的训练数据增强?
- RQ5所提出的评估指标在RACE++数据集之外是否具有良好的泛化能力?
主要发现
- 基于T5的MCQG系统结合过滤机制在RACE++数据集上实现了100%的可回答性与66.29%的多样性,表明其在生成有效且多样化问题方面表现优异。
- 自动化评估框架成功捕捉了语法流畅性、可回答性、多样性和复杂度等关键质量维度,且完全不依赖参考基准指标。
- 使用过滤后的MCQG数据进行数据增强后,下游MCMRC任务在Dev集上性能提升0.36%,在Evl集上提升0.12%。
- GPT-3生成的问题多样性较低(51.04%),且不可回答性较高(71.10%),表明其输出质量存在局限。
- 复杂度分类器在简单、中等与困难问题之间表现出清晰区分,验证了其在评估认知负荷方面的有效性。
- 评估框架揭示部分干扰项本身即为有效答案,凸显了改进干扰项生成策略的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。