Skip to main content
QUICK REVIEW

[论文解读] Variational Attention for Sequence-to-Sequence Models

Hareesh Bahuleyan, Lili Mou|arXiv (Cornell University)|Dec 21, 2017
Topic Modeling参考文献 27被引用 20
一句话总结

本文提出了一种变分注意力机制,将注意力向量建模为服从高斯分布的随机变量,从而防止序列到序列模型中注意力机制绕过变分潜在空间。通过引入具有可学习先验的概率注意力机制,该方法在不牺牲输出质量的前提下提升了生成多样性,实验结果在问题生成和对话系统任务中得到验证。

ABSTRACT

The variational encoder-decoder (VED) encodes source information as a set of random variables using a neural network, which in turn is decoded into target data using another neural network. In natural language processing, sequence-to-sequence (Seq2Seq) models typically serve as encoder-decoder networks. When combined with a traditional (deterministic) attention mechanism, the variational latent space may be bypassed by the attention model, and thus becomes ineffective. In this paper, we propose a variational attention mechanism for VED, where the attention vector is also modeled as Gaussian distributed random variables. Results on two experiments show that, without loss of quality, our proposed method alleviates the bypassing phenomenon as it increases the diversity of generated sentences.

研究动机与目标

  • 为解决变分编码器-解码器(VED)模型中的‘绕过’现象,即确定性注意力使变分潜在空间失效的问题。
  • 通过将概率建模整合到注意力机制中,提升基于VED的文本生成任务中生成序列的多样性。
  • 开发一种通用框架,增强VED模型性能,同时不损害生成质量。

提出的方法

  • 将注意力向量建模为具有高斯分布的随机变量,替代标准Seq2Seq模型中的确定性注意力向量。
  • 为注意力向量引入两种合理的先验分布:标准正态分布,以及均值为编码器隐藏状态平均值的先验分布。
  • 使用变分下界目标端到端训练模型,同时优化重构损失与后验分布和先验分布之间的KL散度。
  • 在训练过程中使用蒙特卡洛采样近似期望值,实现通过随机注意力向量的反向传播。
  • 将该框架应用于序列到序列任务,如问题生成和对话回复生成。

实验结果

研究问题

  • RQ1VED模型中的确定性注意力是否导致变分潜在空间被绕过,从而降低生成多样性?
  • RQ2将注意力向量建模为具有概率先验的随机变量,能否提升生成序列的多样性?
  • RQ3所提出的变分注意力机制与确定性注意力相比,在生成多样性与质量方面表现如何?

主要发现

  • 与确定性注意力相比,所提出的变分注意力机制在问题生成和对话系统中显著提升了句子多样性,如Dist-1和Dist-2指标所示。
  • 在问题生成任务中,VED+VAttn-\bar{h}在采样设置下达到Dist-1为0.324、Dist-2为0.467,优于VED+DAttn(Dist-1: 0.311,Dist-2: 0.450)。
  • 在Cornell Movie-Dialogs Corpus数据集上,VED+VAttn-\bar{h}在采样设置下达到BLEU-2得分为1.79,优于VED+DAttn(1.68),表明生成质量有所提升。
  • 该模型保持了高质量的输出,BLEU-2得分接近确定性模型,表明在提升多样性的同时未造成质量下降。
  • 消融实验确认,先验的选择(如均值为零或隐藏状态的平均值)会影响性能,其中后者表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。