Skip to main content
QUICK REVIEW

[论文解读] Natural Question Generation with Reinforcement Learning Based Graph-to-Sequence Model

Yu Chen, Lingfei Wu|arXiv (Cornell University)|Oct 19, 2019
Topic Modeling参考文献 43被引用 13
一句话总结

本文提出了一种基于强化学习的图到序列模型,用于自然语言问题生成。该模型利用双向门控图神经网络(BiGGNN)编码文本段落的结构,并通过深度对齐网络整合答案信息。模型采用交叉熵与强化学习相结合的混合损失函数,以提升句法和语义质量,在 SQuAD 数据集上实现了最先进的性能,显著优于先前方法。

ABSTRACT

Natural question generation (QG) aims to generate questions from a passage and an answer. In this paper, we propose a novel reinforcement learning (RL) based graph-to-sequence (Graph2Seq) model for QG. Our model consists of a Graph2Seq generator where a novel Bidirectional Gated Graph Neural Network is proposed to embed the passage, and a hybrid evaluator with a mixed objective combining both cross-entropy and RL losses to ensure the generation of syntactically and semantically valid text. The proposed model outperforms previous state-of-the-art methods by a large margin on the SQuAD dataset.

研究动机与目标

  • 解决序列到序列模型在问题生成中的局限性,如暴露偏差和缺乏结构建模能力。
  • 通过深度对齐网络联合建模段落、答案及其全局交互,提升问题质量。
  • 通过结合交叉熵与强化学习的混合训练目标,提升生成问题的句法与语义正确性。
  • 利用基于图的编码方法,捕捉超越顺序依赖关系的更丰富文本结构。
  • 在自动评估与人工评估指标上,实现在 SQuAD 基准测试中的最先进性能。

提出的方法

  • 使用双向门控图神经网络(BiGGNN)通过捕捉图表示中传入与传出边的信息,对段落进行编码。
  • 深度对齐网络(DAN)通过基于注意力的融合(GloVe、BERT 和语言学特征)在词级别与隐藏状态级别实现段落与答案嵌入的软对齐。
  • 将最终的段落表示输入基于 RNN 的解码器,以序列到序列的方式生成问题。
  • 训练一个混合评估器,采用组合目标:结合交叉熵损失用于监督,以及强化学习损失以优化自动评估指标。
  • 模型端到端可训练,并使用 REINFORCE 算法基于人工评估奖励优化强化学习目标。
  • 在 SQuAD 数据集上使用 BLEU-4、ROUGE 以及人工评估(句法、语义与相关性)对模型进行评估。

实验结果

研究问题

  • RQ1具有结构化编码的图到序列模型是否能在自然语言问题生成中超越标准序列到序列模型?
  • RQ2深度对齐网络在将答案信息整合到段落表示中时,其有效性如何,能否提升问题的相关性?
  • RQ3结合交叉熵与强化学习损失在多大程度上能提升生成问题的句法与语义质量?
  • RQ4引入双向图编码是否能增强对段落中长距离依赖与全局交互的建模能力?
  • RQ5所提出的模型在自动评估与人工评估指标上与当前最先进方法相比表现如何?

主要发现

  • 所提模型在 SQuAD split-2 测试集上取得 BLEU-4 得分为 18.30,显著优于强基线模型 MPQG+R(17.49)。
  • 在人工评估中,模型在句法正确性上得分为 4.41,语义正确性为 4.31,相关性为 3.79,分别接近真实标注水平(4.74、4.74、4.25)。
  • 消融实验表明,若移除深度对齐网络,性能急剧下降至 BLEU-4 为 12.58,表明其在答案信息整合中的关键作用。
  • BiGGNN 组件贡献显著,若将其移除并替换为标准 Seq2Seq 模型,性能降至 BLEU-4 为 16.14。
  • 使用 BERT 嵌入与强化学习可进一步提升结果,完整模型(G2S sta + BERT + RL)在 BLEU-4 与人工评估中均取得最高分。
  • 案例研究证实,与基线相比,该模型生成的问题更完整、更相关且语法正确,尤其在答案信息正确对齐时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。