Skip to main content
QUICK REVIEW

[论文解读] Explaining and Generalizing Back-Translation through Wake-Sleep

Ryan Cotterell, Julia Kreutzer|arXiv (Cornell University)|Jun 12, 2018
Topic Modeling参考文献 28被引用 16
一句话总结

本文为神经机器翻译中的回译提供了一种基于变分推断的生成模型解释,将其视为在双语语料生成模型中执行一次唤醒-睡眠算法迭代。该文提出了一种回译的迭代泛化方法,在英语-德语和英语-拉脱维亚语翻译任务中,将翻译性能提升了最高1.6 BLEU,且在同域与跨域设置下均表现出一致的性能增益。

ABSTRACT

Back-translation has become a commonly employed heuristic for semi-supervised neural machine translation. The technique is both straightforward to apply and has led to state-of-the-art results. In this work, we offer a principled interpretation of back-translation as approximate inference in a generative model of bitext and show how the standard implementation of back-translation corresponds to a single iteration of the wake-sleep algorithm in our proposed model. Moreover, this interpretation suggests a natural iterative generalization, which we demonstrate leads to further improvement of up to 1.6 BLEU.

研究动机与目标

  • 为神经机器翻译中的回译提供一种基于生成模型的理论解释。
  • 证明标准回译对应于变分推断框架中的一次唤醒-睡眠迭代。
  • 提出并评估基于唤醒-睡眠算法的回译迭代泛化方法。
  • 在多种语言对和领域中展示翻译质量的持续改进。
  • 为回译建立理论基础,以支持未来的方法扩展。

提出的方法

  • 作者构建了一个完整的双语语料生成模型,其中联合分布被分解为 p(y|x) * p(x),其中 p(y|x) 为翻译模型,p(x) 为语言模型。
  • 将回译解释为一种变分近似,其中反向翻译器充当在给定目标句 y 的情况下对潜在源句 x 进行推断的推理网络。
  • 该方法将回译视为唤醒-睡眠算法的一轮迭代,其中‘唤醒’阶段优化翻译模型,‘睡眠’阶段改进推理网络。
  • 所提出的泛化方法将此过程扩展至多轮唤醒-睡眠迭代,迭代地重新估计前向和反向翻译模型。
  • 模型通过双语语料的最大似然训练,并在单语数据上通过回译进行微调,使用开发集进行早停。
  • 实验采用标准的序列到序列模型,包含注意力机制、GRU、子词分词和标准正则化技术。

实验结果

研究问题

  • RQ1如何在生成建模框架中正式解释回译?
  • RQ2回译与变分推断中唤醒-睡眠算法之间存在何种关系?
  • RQ3对前向和反向翻译模型进行迭代优化能否提升翻译性能?
  • RQ4所提出的回译迭代泛化方法是否在不同语言对和领域中均带来一致的性能增益?
  • RQ5对回译的理论化解释能否指导未来半监督神经机器翻译的改进?

主要发现

  • 所提出的回译迭代泛化方法在英语-德语和英语-拉脱维亚语翻译任务中,相较于标准回译,翻译性能最高提升1.6 BLEU。
  • 最大性能提升出现在领域适应设置中,例如使用TED演讲数据进行半监督领域适应时,增益最为显著。
  • 在WMT(同域)和TED(跨域)设置下,性能提升均具有一致性,且在大多数情况下,首次回译迭代带来的相对增益最大。
  • 该方法验证了回译等价于一次唤醒-睡眠迭代,证实了其与生成模型中变分推断的关联性。
  • 迭代优化过程使单语数据更好地对齐目标分布,减少噪声并提升模型泛化能力。
  • 结果表明,理论严谨的生成建模可为半监督神经机器翻译带来实际性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。