Skip to main content
QUICK REVIEW

[论文解读] Improved Zero-shot Neural Machine Translation via Ignoring Spurious Correlations

Jiatao Gu, Yong Wang|arXiv (Cornell University)|Jun 4, 2019
Natural Language Processing Techniques参考文献 27被引用 13
一句话总结

本文提出两种简单而有效的方法——语言模型预训练和反向翻译——通过缓解源语言标识符与解码输出之间的虚假相关性,改进零样本神经机器翻译。该方法在原始零样本翻译基础上实现最高达22 BLEU的提升,并在多个多语言数据集上达到或超过基于回译的方法的性能。

ABSTRACT

Zero-shot translation, translating between language pairs on which a Neural Machine Translation (NMT) system has never been trained, is an emergent property when training the system in multilingual settings. However, naive training for zero-shot NMT easily fails, and is sensitive to hyper-parameter setting. The performance typically lags far behind the more conventional pivot-based approach which translates twice using a third language as a pivot. In this work, we address the degeneracy problem due to capturing spurious correlations by quantitatively analyzing the mutual information between language IDs of the source and decoded sentences. Inspired by this analysis, we propose to use two simple but effective approaches: (1) decoder pre-training; (2) back-translation. These methods show significant improvement (4~22 BLEU points) over the vanilla zero-shot translation on three challenging multilingual datasets, and achieve similar or better results than the pivot-based approach.

研究动机与目标

  • 解决原始零样本NMT的不稳定性和性能低下问题,其性能通常落后于基于回译的方法。
  • 探究零样本NMT失败的根本原因,将源语言标识符与解码输出之间的虚假相关性识别为关键退化因素。
  • 开发实用且有效的方法,改进零样本翻译,而无需为未见语言对提供平行单语数据。
  • 缩小零样本NMT与基于回译的翻译之间的性能差距,特别是在长回译链或低资源设置下。
  • 在包括Europarl、IWSLT和MultiUN在内的多种多语言数据集上展示鲁棒性和一致的性能提升。

提出的方法

  • 通过量化分析源语言标识符与解码输出之间的互信息,诊断虚假相关性作为零样本NMT失败的根本原因。
  • 应用语言模型预训练(LM预训练)以利用更好的语言特定归纳偏置初始化解码器,减少对虚假语言ID信号的依赖。
  • 使用反向翻译(BTZS)通过目标语言中的合成平行句对增强训练数据,提升零样本泛化能力。
  • 在推理过程中将语言ID作为初始解码器标记(y₀ = j)以引导翻译至正确的目标语言。
  • 使用共享表示空间训练包含K+1种语言的多语言NMT模型,最大化可用平行对的似然。
  • 联合应用语言模型预训练和反向翻译,以进一步稳定并提升零样本翻译性能。

实验结果

研究问题

  • RQ1尽管进行了多语言预训练,原始零样本NMT为何会失败,其不稳定性背后的根源是什么?
  • RQ2源语言标识符与解码输出之间的虚假相关性在多大程度上损害了零样本翻译的质量?
  • RQ3语言模型预训练能否减少对虚假语言ID信号的依赖,并改善零样本泛化能力?
  • RQ4反向翻译能否在无需为未见语言对提供平行数据的情况下有效提升零样本NMT性能?
  • RQ5在BLEU分数、鲁棒性和长回译链中的可扩展性方面,所提出方法与基于回译的翻译相比如何?

主要发现

  • 本文通过互信息分析验证,识别出源语言标识符与解码输出之间的虚假相关性是零样本NMT失败的主要原因。
  • 语言模型预训练减少了对虚假语言ID信号的依赖,从而带来更稳定、更流畅的零样本翻译结果。
  • 反向翻译(BTZS)显著提升了零样本NMT性能,尤其在低资源或未见语言对中表现突出。
  • 在IWSLT和MultiUN数据集上,所提方法相比原始零样本NMT最高实现22 BLEU点的性能提升。
  • 在长回译链(如De→En→It→Ro→Nl)中,采用所提方法的零样本NMT性能优于基于回译的翻译2–3 BLEU点,避免了误差累积。
  • LM预训练与BTZS联合使用的综合方法在所有评估数据集(包括Europarl、IWSLT和MultiUN)上均达到或超过基于回译的方法的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。