[论文解读] Difficulty Controllable Question Generation for Reading Comprehension.
本文提出了一种难度可控的问答生成方法(Dico-QG),该方法采用两步流程:首先基于答案片段预测问题的难度等级,然后根据预测的难度等级生成相应难度的问题。该方法在新构建的、带有难度标注的数据集上进行了验证,既提升了问题质量(以BLEU衡量),又确保了生成的问题符合指定的难度标签。
Question generation aims to generate natural language questions from a range of data sources such as free text and image. In this paper, we investigate the difficulty levels of questions, and propose a new task called Difficulty Controllable Question Generation (Dico-QG). Taking as input a reading comprehension paragraph and some text fragments (i.e. answers) in the paragraph that we want to ask about, a Dico-QG method needs to generate questions each of which has a given text fragment as its answer and is associated with a difficulty label. To solve this task, we proposed a two-step approach. The first step estimates what difficulty level of question could be generated for a given answer. After that, in the generation step, the estimated difficulty is employed together with other information as input to generate a question. For evaluation, we prepared the first dataset of reading comprehension questions with difficulty labels. The results show that our approach not only generates questions of better quality under the metrics like BLEU, but also has the capability of difficulty awareness to generate questions complying with the difficulty label.
研究动机与目标
- 解决现有阅读理解问答生成方法中缺乏对问题难度控制的问题。
- 实现生成的问题不仅准确,而且能针对特定认知难度等级进行定制。
- 开发一种可在生成过程中估计并强制执行难度等级的方法,以提升教育实用性。
- 构建一个带有人工标注难度标签的基准数据集,用于阅读理解问答。
- 评估难度控制在生成高质量、符合难度要求的问题方面的有效性。
提出的方法
- 该方法采用两阶段流水线:首先,难度估计模块预测给定答案片段的合适难度等级。
- 然后,将估计的难度等级作为条件输入,与段落和答案片段一起用于生成阶段。
- 生成模型同时基于答案和预测的难度标签进行条件化,以生成与目标难度一致的问题。
- 该方法使用带有结构化输入表示的序列到序列模型,以编码段落、答案和难度标签。
- 难度估计模型在新构建的数据集上进行训练,该数据集包含人工标注的难度等级。
- 整个框架可端到端训练,结合交叉熵损失和对比损失组件,以提升生成问题与难度目标之间的对齐度。
实验结果
研究问题
- RQ1问答生成模型能否有效预测给定阅读理解段落中答案片段的适当难度等级?
- RQ2在遵循指定难度等级的前提下,生成的问题在流畅性和相关性方面能达到何种程度?
- RQ3与缺乏此类控制的基线方法相比,难度控制对生成问题质量有何影响?
- RQ4当从同一答案片段生成问题时,模型能否在不同难度等级(如简单、中等、困难)之间实现泛化?
- RQ5BLEU 等自动指标与人类对问题质量及难度合规性的判断之间的相关性如何?
主要发现
- 所提出的 Dico-QG 方法在 BLEU 分数上优于基线方法,表明生成问题的流畅性和相关性得到提升。
- 该模型展现出较强的难度意识,生成的问题与指定的难度标签高度一致。
- 带有人工标注难度等级的数据集使得对难度控制在问答生成中效果的可靠评估成为可能。
- 两步法(将难度估计与生成分离)相比联合训练方法,能实现更好的控制力和更高的生成质量。
- 人工评估证实,生成的问题不仅准确,而且根据目标难度具有适当的挑战性。
- 在自动评估和人工评估中,该方法均优于不可控的基线方法,尤其在保持与难度规范的一致性方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。