[论文解读] Automatic Generation of Multiple-Choice Questions
本文提出两种深度学习方法——TP3(基于T5的端到端模型,包含预处理和后处理)和MetaQA(利用语义和句法标签的元序列学习方法),用于自动生成语法正确、语境相关且高质量干扰项的多项选择题(MCQ)。该系统在SAT模拟测试中达到97%的准确率,生成的干扰项在语义上合理且具备足够迷惑性,其中96%的干扰项提供充分迷惑性,84%的MCQ完全符合标准。
Creating multiple-choice questions to assess reading comprehension of a given article involves generating question-answer pairs (QAPs) and adequate distractors. We present two methods to tackle the challenge of QAP generations: (1) A deep-learning-based end-to-end question generation system based on T5 Transformer with Preprocessing and Postprocessing Pipelines (TP3). We use the finetuned T5 model for our downstream task of question generation and improve accuracy using a combination of various NLP tools and algorithms in preprocessing and postprocessing to select appropriate answers and filter undesirable questions. (2) A sequence-learning-based scheme to generate adequate QAPs via meta-sequence representations of sentences. A meta-sequence is a sequence of vectors comprising semantic and syntactic tags. we devise a scheme called MetaQA to learn meta sequences from training data to form pairs of a meta sequence for a declarative sentence and a corresponding interrogative sentence. The TP3 works well on unseen data, which is complemented by MetaQA. Both methods can generate well-formed and grammatically correct questions. Moreover, we present a novel approach to automatically generate adequate distractors for a given QAP. The method is a combination of part-of-speech tagging, named-entity tagging, semantic-role labeling, regular expressions, domain knowledge bases, word embeddings, word edit distance, WordNet, and other algorithms.
研究动机与目标
- 解决在阅读理解评估中自动生成语法正确、语境相关多项选择题(MCQ)的挑战。
- 开发一种方法,生成的干扰项不仅语法正确,而且语义相关且足够具有迷惑性,以确保需理解原文才能作答。
- 结合POS词性标注、命名实体识别和语义角色标注等自然语言处理技术,以提升生成干扰项的质量与相关性。
- 在真实的SAT模拟阅读测试上评估生成的MCQ,以确保高准确率及在教育场景中的实际适用性。
- 通过元序列学习方法补充基于深度学习的生成,以增强泛化能力并减少生成内容不连贯的问题。
提出的方法
- TP3使用微调后的T5 Transformer模型,结合预处理流程以选择合适答案,并通过后处理流程过滤不连贯的问题。
- MetaQA采用由语义角色(SR)、词性(POS)和命名实体(NE)标签组成的元序列,表示陈述句及其对应的疑问句形式。
- 该方法从训练数据中学习元序列-陈述句-疑问句对(MSDIP),通过匹配和转换元序列,将陈述句映射为疑问句形式。
- 在干扰项生成中,将目标词分类为三类——类型1(数量类)、类型2(人物/地点/组织)和类型3(其他),并应用对应类型的替换策略。
- 系统整合POS词性标注、命名实体识别、语义角色标注和fastText嵌入,以确保干扰项的语法正确性和语义合理性。
- 通过用语义相似但语法一致的替代词替换目标词来生成干扰项,同时保持词性与句法结构不变。

实验结果
研究问题
- RQ1基于T5的端到端模型,结合预处理和后处理流程,能否实现高准确率地生成语法正确且语境相关的多项选择题?
- RQ2利用语义和句法标签的元序列学习方法,能否有效从陈述句中生成多样化且连贯的问题?
- RQ3结合NLP工具与类型特定替换策略,能否生成语法正确且足够具有迷惑性的干扰项?
- RQ4生成的MCQ在多大程度上与真实SAT模拟测试题的质量和难度相匹配?
- RQ5生成的干扰项在多大程度上能要求理解文章内容,而非仅通过问题本身进行解析?
主要发现
- MetaQA模型在官方SAT模拟阅读测试中达到97%的准确率,表明其在真实世界、多样化的句子模式下表现强劲。
- TP3模型在Gaokao-EN数据集上准确率超过95%,展现出对未见数据的强大泛化能力。
- 98%的生成干扰项(303个中的296个)与问题相关并提供充分迷惑性,表明其具有高度的语义合理性。
- 96%的干扰项(303个中的291个)提供充分迷惑性,意味着正确答案只能在理解文章内容的基础上选出,而非仅通过问题解析。
- 84%的生成MCQ完全符合标准,三个干扰项均语法正确、语义相关且具有足够迷惑性。
- 所有生成的干扰项均语法正确,无MCQ因语法错误被拒绝,证实了其高语言质量。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。