Skip to main content
QUICK REVIEW

[论文解读] Assessing Factoid Question-Answer Generation for Portuguese (Short Paper)

Ferreira, João, Rodrigues, Ricardo|arXiv (Cornell University)|May 4, 2017
Topic Modeling参考文献 31被引用 52
一句话总结

本文提出了一种结合注意力机制与指针-Softmax机制的序列到序列神经模型,用于从文本段落和预定义答案生成事实型问题。该模型结合了最大似然训练与基于流畅性(困惑度)、可回答性(问答模型性能)及二者混合的奖励函数的策略梯度优化,结果表明,策略梯度微调显著提升了基线模型的问题质量,尤其是在可回答性方面。

ABSTRACT

We propose a recurrent neural model that generates natural-language questions from documents, conditioned on answers. We show how to train the model using a combination of supervised and reinforcement learning. After teacher forcing for standard maximum likelihood training, we fine-tune the model using policy gradient techniques to maximize several rewards that measure question quality. Most notably, one of these rewards is the performance of a question-answering system. We motivate question generation as a means to improve the performance of question answering systems. Our model is trained and evaluated on the recent question-answering dataset SQuAD.

研究动机与目标

  • 开发一种端到端的、文本到文本的神经模型,用于根据文档和答案生成自然语言问题。
  • 通过引入与任务相关的奖励函数,结合强化学习,提升最大似然训练之外的问题质量。
  • 评估不同奖励组合(流畅性(PPL)、可回答性(QA)及混合(RPPL + QA))对生成问题质量的影响。
  • 探究是否通过使用下游问答模型的性能作为奖励,能够提升模型生成既流畅又可回答的问题的能力。
  • 探索神经问题生成中流畅性、具体性与抽象性之间的权衡及其平衡方法。

提出的方法

  • 采用编码器-解码器架构,为文档和答案分别设置独立编码器,利用注意力机制对齐相关上下文。
  • 采用指针-Softmax机制从文档或答案中复制词语,提升命名实体和关键词的生成效果。
  • 使用教师强制策略,在SQuAD数据集的(文档,答案,问题)三元组上进行最大似然估计训练。
  • 通过策略梯度(类似REINFORCE)优化方法对模型进行微调,以最大化辅助奖励:语言模型困惑度(PPL)、问答系统准确率(QA),以及加权组合(RPPL + QA)。
  • 在策略梯度训练过程中应用熵正则化与Dropout,以防止过拟合。
  • 使用自动指标(BLEU、F1、PPL)与人工评估相结合的方式对生成问题进行评估,并对问题的具体性与流畅性进行定性分析。

实验结果

研究问题

  • RQ1神经序列到序列模型能否在给定文档和预定义答案的条件下,生成高质量的事实型问题?
  • RQ2将最大似然训练与策略梯度优化相结合,相较于标准监督训练,能否显著提升问题生成质量?
  • RQ3不同奖励函数(流畅性(PPL)、可回答性(QA)或其组合)在多大程度上影响生成问题的具体性、流畅性与可回答性?
  • RQ4若以下游问答模型的性能作为训练奖励,是否能生成更可能被现有问答系统正确回答的问题?
  • RQ5在神经问题生成中,流畅性、具体性与抽象性之间存在何种权衡?如何实现有效平衡?

主要发现

  • 采用QA奖励(RQA)的策略梯度训练使生成问题的问答准确率相比改进后的Seq2Seq基线模型提升了8.9%,显著增强了可回答性。
  • RQA训练方案在测试集上达到73.7%的QA得分,略高于基线模型在真实问题上的73.2%准确率,表明生成器可能已学会利用问答模型的答题模式。
  • 混合训练方案(RPPL + QA)在流畅性与可回答性之间实现了最佳平衡,在大幅超越最大似然基线的同时,也部分恢复了困惑度性能。
  • 在RQA设置下生成的问题流畅性较差,表现为困惑度更高(如405 vs. 基线的114),表明可回答性与流畅性之间存在权衡。
  • 模型学会了将疑问词(如'what'、'when')置于句末,这种模式与训练数据更相似,有助于提升与问答模型的匹配度,但可能降低自然性。
  • 尽管BLEU得分较高,模型在抽象能力方面表现不佳,常生成与输入词汇重叠度高的问题,表明其在重新表述或超越表面重排的推理能力有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。