Skip to main content
QUICK REVIEW

[论文解读] Variational Recurrent Neural Machine Translation

Jinsong Su, Shan Wu|arXiv (Cornell University)|Jan 16, 2018
Natural Language Processing Techniques参考文献 27被引用 11
一句话总结

该论文提出了一种新型神经机器翻译模型——变分循环神经机器翻译(VRNMT),通过引入一系列循环潜在变量来捕捉翻译过程中目标词之间的复杂依赖关系。通过将这些变量整合到解码器的隐藏状态中,并采用重参数化变分推理框架,VRNMT在中英和英德翻译任务上相较于传统NMT和变分NMT均取得了显著的BLEU分数提升。

ABSTRACT

Partially inspired by successful applications of variational recurrent neural networks, we propose a novel variational recurrent neural machine translation (VRNMT) model in this paper. Different from the variational NMT, VRNMT introduces a series of latent random variables to model the translation procedure of a sentence in a generative way, instead of a single latent variable. Specifically, the latent random variables are included into the hidden states of the NMT decoder with elements from the variational autoencoder. In this way, these variables are recurrently generated, which enables them to further capture strong and complex dependencies among the output translations at different timesteps. In order to deal with the challenges in performing efficient posterior inference and large-scale training during the incorporation of latent variables, we build a neural posterior approximator, and equip it with a reparameterization technique to estimate the variational lower bound. Experiments on Chinese-English and English-German translation tasks demonstrate that the proposed model achieves significant improvements over both the conventional and variational NMT models.

研究动机与目标

  • 为解决传统NMT和变分NMT在翻译过程中对相邻目标词之间强而复杂的依赖关系建模能力不足的问题。
  • 探索循环潜在变量在捕捉神经机器翻译中层次化与序列化语义结构方面的潜力。
  • 开发一种端到端可训练的NMT框架,结合变分推理与循环建模的优势,以提升翻译质量。
  • 克服在序列到序列模型中引入潜在变量时面临的后验推断不可计算性和大规模训练的挑战。

提出的方法

  • 引入一系列连续的潜在随机变量 {z₁, z₂, ..., z_Ty},这些变量以循环方式生成,并被整合到解码器的隐藏状态中,以建模上下文依赖关系。
  • 将条件翻译概率 p(y|x) 分解为时间步的乘积形式,在每个时间步对潜在变量 z_j 进行积分,以捕捉动态的语义上下文。
  • 采用神经后验近似器 qφ(z_j|x, y≤j) 来估计潜在变量的不可计算后验分布,利用观测到的源序列和目标序列进行近似。
  • 利用重参数化技巧实现对潜在变量的可微分、随机反向传播,从而支持通过随机梯度下降进行端到端训练。
  • 采用变分下界(ELBO)进行优化,其中先验 pθ(z_j|x, y<j) 和后验 qφ(z_j|x, y≤j) 均由深度神经网络建模。
  • 将变分循环神经网络(VRNN)框架适配于序列到序列的翻译任务,将变分自编码器范式扩展至NMT。

实验结果

研究问题

  • RQ1一系列循环潜在变量是否能够提升神经机器翻译中相邻目标词之间复杂依赖关系的建模能力?
  • RQ2如何有效将带重参数化的变分推理应用于具有潜在变量的序列到序列模型?
  • RQ3在NMT中引入潜在空间的循环结构是否能带来优于单个全局潜在变量的性能提升?
  • RQ4所提出的模型是否能在保持端到端可微性和大规模训练可扩展性的前提下,实现最先进性能?

主要发现

  • 在中英翻译任务中,VRNMT取得了30.1的BLEU分数,相比传统NMT模型高出5.39个BLEU点。
  • 在英德翻译任务中,VRNMT取得了28.7的BLEU分数,相比传统NMT模型高出1.05个BLEU点。
  • 在中英翻译任务中,VRNMT相比变分NMT(VNMT)提升了0.44个BLEU点;在英德翻译任务中提升了0.59个BLEU点。
  • 与多个近期的SOTA NMT系统相比,该模型表现出具有竞争力的性能,表明其有效性和泛化能力。
  • 消融实验表明,潜在变量的循环结构显著提升了翻译质量,优于静态或单个潜在变量的方法。
  • 该模型与现有NMT架构正交,表明可与其他SOTA技术结合以实现进一步的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。