Skip to main content
QUICK REVIEW

[论文解读] Latent-Variable Non-Autoregressive Neural Machine Translation with Deterministic Inference Using a Delta Posterior

Raphael Shu, Jason Lee|arXiv (Cornell University)|Aug 20, 2019
Natural Language Processing Techniques参考文献 33被引用 12
一句话总结

该论文提出 LaNMT,一种使用连续潜在变量和通过 delta 后验进行确定性推理的非自回归神经机器翻译模型,以实现快速、并行解码。通过迭代优化潜在变量以提升翻译质量,同时动态调整序列长度,该模型在 ASPEC Ja-En 上实现比自回归模型快 8.6 倍的解码速度,并在 WMT’14 En-De 上将 BLEU 差距缩小至仅 1.0 分,同时实现 6.8 倍的加速,方法包括使用多个潜在候选和教师模型重打分。

ABSTRACT

Although neural machine translation models reached high translation quality, the autoregressive nature makes inference difficult to parallelize and leads to high translation latency. Inspired by recent refinement-based approaches, we propose LaNMT, a latent-variable non-autoregressive model with continuous latent variables and deterministic inference procedure. In contrast to existing approaches, we use a deterministic inference algorithm to find the target sequence that maximizes the lowerbound to the log-probability. During inference, the length of translation automatically adapts itself. Our experiments show that the lowerbound can be greatly increased by running the inference algorithm, resulting in significantly improved translation quality. Our proposed model closes the performance gap between non-autoregressive and autoregressive approaches on ASPEC Ja-En dataset with 8.6x faster decoding. On WMT'14 En-De dataset, our model narrows the gap with autoregressive baseline to 2.0 BLEU points with 12.5x speedup. By decoding multiple initial latent variables in parallel and rescore using a teacher model, the proposed model further brings the gap down to 1.0 BLEU point on WMT'14 En-De task with 6.8x speedup.

研究动机与目标

  • 解决自回归 NMT 模型因顺序生成词元而导致的高推理延迟问题。
  • 克服现有非自回归 NMT 模型固定目标长度、在词序和一致性方面表现不佳的局限性。
  • 通过引入连续潜在变量,在不牺牲解码速度的前提下提升非自回归模型的翻译质量。
  • 开发一种避免随机性的确定性推理过程,以实现高效、可扩展的解码。
  • 通过潜在变量的迭代优化和教师模型重打分,缩小非自回归与自回归 NMT 模型之间的性能差距。

提出的方法

  • 引入一系列连续潜在变量,每个输入词元对应一个,以建模目标序列中的不确定性。
  • 使用长度转换机制,动态调整潜在向量的数量以匹配目标序列长度。
  • 通过最大化对数似然 log p(y|x) 的证据下界(ELBO)端到端训练模型。
  • 提出一种基于 delta 后验的确定性迭代推理算法,交替更新潜在变量后验并使用 delta 后验优化目标词元。
  • 从先验 p(z|x) 初始化后验,从 p(y|x,z) 初始化目标,然后利用近似后验 q(z|x,y) 同时优化两者。
  • 通过采样多个初始潜在变量并使用自回归教师模型重打分,实现并行解码,从而提升翻译质量。

实验结果

研究问题

  • RQ1连续潜在变量是否能通过实现动态长度适配和更好的序列建模,提升非自回归 NMT?
  • RQ2基于 delta 后验的确定性推理算法是否能在不使用随机采样的前提下实现高翻译质量?
  • RQ3潜在变量的迭代优化是否能显著提升翻译质量并提高对数似然的下界?
  • RQ4通过潜在变量优化和教师模型重打分,能否有效缩小非自回归与自回归 NMT 模型之间的性能差距?
  • RQ5在保持竞争力 BLEU 分数的前提下,该方法在多大程度上能提升解码速度?

主要发现

  • 所提出的确定性推理算法显著提升了证据下界和翻译质量,BLEU 分数在仅一次优化步骤后即实现收敛。
  • 在 ASPEC Ja-En 数据集上,LaNMT 的解码速度比自回归基线快 8.6 倍,同时保持相同性能水平。
  • 在 WMT’14 En-De 数据集上,仅使用推理算法,模型将与自回归基线的 BLEU 差距缩小至 2.0 分,同时实现 12.5 倍加速。
  • 通过解码多个初始潜在变量并使用教师模型重打分,WMT’14 En-De 上的 BLEU 差距进一步缩小至 1.0 分,同时实现 6.8 倍加速。
  • 定性分析表明,模型能通过在优化过程中插入或删除词语,动态纠正初始长度预测错误。
  • 该方法在处理复杂词序重排和从句插入方面表现优异,示例显示整个从句可在推理过程中被添加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。