Skip to main content
QUICK REVIEW

[论文解读] Difficulty Controllable Generation of Reading Comprehension Questions

Yifan Gao, Lidong Bing|arXiv (Cornell University)|Jul 10, 2018
Topic Modeling参考文献 27被引用 15
一句话总结

本文提出难度可控的阅读理解问题生成(DQG),一种端到端框架,通过利用位置感知嵌入和全局难度变量,生成指定难度级别的阅读理解问题。该方法在新构建的包含76,000个SQuAD问题且经人工标注难度标签的数据集上验证,实现了卓越的问题质量与强大的难度控制能力。

ABSTRACT

We investigate the difficulty levels of questions in reading comprehension datasets such as SQuAD, and propose a new question generation setting, named Difficulty-controllable Question Generation (DQG). Taking as input a sentence in the reading comprehension paragraph and some of its text fragments (i.e., answers) that we want to ask questions about, a DQG method needs to generate questions each of which has a given text fragment as its answer, and meanwhile the generation is under the control of specified difficulty labels---the output questions should satisfy the specified difficulty as much as possible. To solve this task, we propose an end-to-end framework to generate questions of designated difficulty levels by exploring a few important intuitions. For evaluation, we prepared the first dataset of reading comprehension questions with difficulty labels. The results show that the question generated by our framework not only have better quality under the metrics like BLEU, but also comply with the specified difficulty labels.

研究动机与目标

  • 为解决阅读理解中缺乏难度可控问题生成的问题,这一设置此前在自然语言处理领域尚未被探索。
  • 构建首个大规模阅读理解问题数据集,对问题难度进行人工标注,以支持难度可控模型的训练与评估。
  • 开发一种神经生成框架,生成针对特定难度级别的问题,同时保持高事实准确性和句法正确性。
  • 探索如何建模接近提示(proximity hints)和全局难度信号,以引导问题生成达到期望的难度水平。
  • 使用预训练阅读理解模型作为代理指标,评估生成问题的难度。

提出的方法

  • 该框架采用序列到序列架构,结合位置嵌入以编码非停用词到答案片段的距离,从而建模接近提示以实现难度控制。
  • 引入全局难度变量作为潜在表征,以条件控制整个问题生成过程,使其基于指定难度级别(如简单或困难)进行生成。
  • 模型采用交叉熵损失进行端到端训练,并结合答案感知解码,以确保生成的问题聚焦于指定答案。
  • 设计了一种新颖的数据收集管道,通过结合语言学线索和阅读理解模型置信度分数,自动为现有SQuAD问题标注多种难度级别。
  • 框架整合了答案感知注意力机制,以确保生成的问题与输入句子和答案片段相关且可回答。
  • 通过预训练阅读理解模型(如BERT)预测答案跨度并计算置信度分数,作为问题难度的代理指标,完成难度评估。

实验结果

研究问题

  • RQ1是否可以训练神经问题生成模型,在保持高事实准确性和句法质量的前提下,生成具有可控难度的问题?
  • RQ2如何建模输入句子中的接近提示(如答案附近的词语)以影响问题难度?
  • RQ3全局难度变量是否能有效引导模型从同一组输入句子和答案对生成不同难度的问题?
  • RQ4是否可行构建大规模、高质量的阅读理解问题数据集,包含显式的难度标注?
  • RQ5预训练阅读理解模型能否作为评估生成问题难度的可靠代理?

主要发现

  • 所提出的DQG框架在自动问题质量指标上达到最先进性能,BLEU分数相比基线方法最高提升20.79。
  • 具备难度控制能力的模型(DLPH-GDC)在对齐生成问题与指定难度级别方面表现最佳,其RC模型置信度分数显示其具备最强的难度控制能力。
  • 使用位置感知嵌入显著提升了问题质量,QWPH变体在BLEU和答案相关性方面均优于Ans基线模型。
  • 该框架能从同一输入句子和答案对成功生成简单和困难的问题,其中简单问题包含更多接近提示(平均到答案词的距离更短)。
  • 自动难度标注方法成功生成了76,000个带有难度标注的SQuAD问题,使首次大规模研究难度可控问题生成成为可能。
  • 案例研究证实,模型生成的问题更具聚焦性和上下文相关性;DLPH-GDC生成的简单问题使用了更多邻近词语,而困难问题则使用更少、更远距离的提示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。