Skip to main content
QUICK REVIEW

[论文解读] Generating Distractors for Reading Comprehension Questions from Real Examinations

Yifan Gao, Lidong Bing|arXiv (Cornell University)|Sep 8, 2018
Topic Modeling参考文献 22被引用 13
一句话总结

本文提出一种具有动态与静态注意力机制的层次编码器-解码器模型,用于从真实考试中生成长篇、语义丰富的干扰项,以应对多项选择阅读理解题。该模型在自动评估与人工评估中均优于强基线模型,生成的干扰项语境相关、语法正确,难以与人工编写的干扰项区分。

ABSTRACT

We investigate the task of distractor generation for multiple choice reading comprehension questions from examinations. In contrast to all previous works, we do not aim at preparing words or short phrases distractors, instead, we endeavor to generate longer and semantic-rich distractors which are closer to distractors in real reading comprehension from examinations. Taking a reading comprehension article, a pair of question and its correct option as input, our goal is to generate several distractors which are somehow related to the answer, consistent with the semantic context of the question and have some trace in the article. We propose a hierarchical encoder-decoder framework with static and dynamic attention mechanisms to tackle this task. Specifically, the dynamic attention can combine sentence-level and word-level attention varying at each recurrent time step to generate a more readable sequence. The static attention is to modulate the dynamic attention not to focus on question irrelevant sentences or sentences which contribute to the correct option. Our proposed framework outperforms several strong baselines on the first prepared distractor generation dataset of real reading comprehension questions. For human evaluation, compared with those distractors generated by baselines, our generated distractors are more functional to confuse the annotators.

研究动机与目标

  • 解决生成真实考试风格多项选择阅读理解题中长篇、语义丰富的干扰项的挑战,而非短语或单词级别的干扰项。
  • 克服先前抽取-选择或基于规则的方法在生成语境连贯、语法正确的干扰项方面的局限性。
  • 确保生成的干扰项与正确答案语义相关,与问题上下文一致,并在原文中留下痕迹。
  • 提升干扰项的真实感与混淆潜力,以更好地模拟真实评估(如 RACE 数据集)中人工设计的选项。
  • 构建一个数据驱动的端到端序列到序列框架,直接从文章-问题-正确答案三元组学习生成干扰项。

提出的方法

  • 采用层次编码器-解码器架构,以捕捉阅读理解文章中的长距离依赖关系,同时建模句子级与词级表示。
  • 引入动态注意力机制,在每个解码步骤自适应地结合句子级与词级注意力,以生成更流畅、更易读的干扰项序列。
  • 设计静态注意力机制,以抑制对问题无关句子及贡献于正确答案的句子的注意力,防止模型复制或改写正确选项。
  • 使用基于问题的初始化器,将解码过程与问题条件化,确保生成的干扰项与问题的语义意图相关。
  • 在新构建的真实考试多项选择题数据集上,采用端到端序列到序列学习进行训练,优化流畅性与相关性。
  • 结合自动指标(如 BLEU、ROUGE)与人工评估,以衡量生成干扰项的质量与混淆潜力。

实验结果

研究问题

  • RQ1具有层次注意力的序列到序列模型能否生成针对真实考试风格阅读理解题的长篇、语境相关且语法正确的干扰项?
  • RQ2动态注意力在结合句子级与词级上下文方面,对提升生成干扰项的流畅性与连贯性有多大的有效性?
  • RQ3静态注意力机制在多大程度上减少了对答案相关句子的注意力,从而防止模型复制或改写正确答案?
  • RQ4与人工编写的干扰项相比,生成的干扰项在人类标注者中的混淆率如何?
  • RQ5所提出的框架是否能在真实世界干扰项生成任务中,同时优于现有基线模型的自动评估与人工评估表现?

主要发现

  • 所提模型在首个公开的真实考试干扰项生成数据集上,优于强基线模型(Seq2Seq 与 HRED),在 BLEU 与 ROUGE 等自动评估指标上表现更优。
  • 人工评估显示,该模型生成的干扰项显著更易使标注者产生混淆,其混淆率在所有方法中最高。
  • 静态注意力机制成功抑制了对包含正确答案句子的注意力,降低了生成语义相同或改写后干扰项的风险。
  • 案例研究证实,模型生成的干扰项与文章中相关句子语义关联紧密,同时避免过度依赖高频词或无关术语。
  • 该模型生成的干扰项在语境连贯性与语法一致性方面更优,尤其在需要多句推理的推理类问题中表现更佳。
  • 该模型在人工评估中的干扰项混淆率为 42.5%,显著高于 HRED 的 35.6% 与 Seq2Seq 的 28.9%,表明其在真实感与有效性方面具有优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。