Skip to main content
QUICK REVIEW

[论文解读] Question Generation from Paragraphs: A Tale of Two Hierarchical Models

Vishwajeet Kumar, Raktim Chaki|arXiv (Cornell University)|Nov 8, 2019
Topic Modeling参考文献 19被引用 4
一句话总结

本文提出了两种用于段落级问题生成的新型层次化模型:一种是带有选择性注意力机制的层次化BiLSTM,另一种是层次化Transformer架构。两种模型通过逐层处理句子中的词和段落中的句子,实现对段落的层次化编码,并利用注意力机制提升生成问题的相关性和流畅性。层次化Transformer在句法和语义正确性方面优于所有基线模型,而层次化BiLSTM在相关性得分上表现最高,证明了层次化建模在长上下文问题生成中的有效性。

ABSTRACT

Automatic question generation from paragraphs is an important and challenging problem, particularly due to the long context from paragraphs. In this paper, we propose and study two hierarchical models for the task of question generation from paragraphs. Specifically, we propose (a) a novel hierarchical BiLSTM model with selective attention and (b) a novel hierarchical Transformer architecture, both of which learn hierarchical representations of paragraphs. We model a paragraph in terms of its constituent sentences, and a sentence in terms of its constituent words. While the introduction of the attention mechanism benefits the hierarchical BiLSTM model, the hierarchical Transformer, with its inherent attention and positional encoding mechanisms also performs better than flat transformer model. We conducted empirical evaluation on the widely used SQuAD and MS MARCO datasets using standard metrics. The results demonstrate the overall effectiveness of the hierarchical models over their flat counterparts. Qualitatively, our hierarchical models are able to generate fluent and relevant questions

研究动机与目标

  • 为解决从长段落文本中生成高质量、相关性问题的挑战,该挑战相较于句子级问题生成仍处于研究不足状态。
  • 设计层次化神经架构,将段落建模为句子序列,将句子建模为词序列,更有效地捕捉长距离依赖关系。
  • 评估层次化注意力机制在提升问题相关性和流畅性方面相较于平面序列模型的有效性。
  • 在SQuAD和MS MARCO数据集上,比较层次化BiLSTM与Transformer模型在自动评估与人工评估指标上的性能表现。

提出的方法

  • 层次化BiLSTM模型(HierSeq2Seq + AE)使用BiLSTM对每个句子中的词进行编码,再通过另一层BiLSTM将句子编码为段落级表示,并引入词级与句子级的选择性注意力机制,以聚焦于关键内容。
  • 层次化Transformer模型(HierTransSeq2Seq + AE)在词与句子两个层级均使用多头注意力机制构建层次化表示,并引入位置编码以保持序列顺序信息。
  • 在词与句子两个层级均应用选择性注意力机制,以动态关注对问题生成至关重要的标记与句子。
  • 模型采用自编码(AE)机制以提升训练稳定性,并生成更流畅的问题。
  • 两种模型均采用端到端的编码器-解码器框架,结合注意力机制进行训练,优化自动评估指标(BLEU、ROUGE)与人工评估指标。
  • 在SQuAD与MS MARCO数据集上,通过标准自动评估指标与人工标注的句法、语义与相关性评估,对模型架构进行评估。

实验结果

研究问题

  • RQ1与平面序列模型相比,将段落以句子为单位、句子以词为单位进行层次化建模,是否能提升问题生成的质量?
  • RQ2在层次化BiLSTM与Transformer模型中,词级与句子级的选择性注意力机制如何增强生成问题的相关性与流畅性?
  • RQ3层次化Transformer架构是否在生成句法与语义正确的问题方面优于层次化BiLSTM?
  • RQ4层次化模型在多大程度上缩小了自动评估与人工评估指标之间的差距?
  • RQ5层次化模型的失败模式是什么?其与长上下文建模和注意力机制有何关联?

主要发现

  • 层次化BiLSTM模型(HierSeq2Seq + AE)在SQuAD数据集上的BLEU2–BLEU4指标上表现最佳,并在MS MARCO数据集的所有自动评估指标上均保持稳定优异的表现。
  • 层次化Transformer模型(HierTransSeq2Seq + AE)在SQuAD与MS MARCO数据集的人工评估中,句法与语义正确性方面全面优于所有基线模型,其中在SQuAD数据集上的句法得分为86,语义得分为73.33。
  • 在人工评估中,层次化BiLSTM模型在SQuAD数据集上达到最高的相关性得分51.33,在MS MARCO数据集上为50.00,显著优于其他模型,表现出更强的问题与输入段落的相关性。
  • 在MS MARCO数据集上,层次化BiLSTM模型在所有自动评估指标上均优于层次化Transformer模型,表明存在数据集相关的性能差异。
  • 层次化模型在自动评估与人工评估中均显著优于其平面基线模型,证明层次化表征学习对长上下文问题生成至关重要。
  • 人工评估显示,层次化Transformer模型在句法方面达到了最高的评分者一致性(kappa = 0.87),表明在语法正确性上存在高度共识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。