Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Dual Machine Translation

Lierni Sestorain, Massimiliano Ciaramita|arXiv (Cornell University)|May 25, 2018
Natural Language Processing Techniques参考文献 20被引用 18
一句话总结

本文提出了一种零样本双语机器翻译框架,结合多语言神经机器翻译与基于强化学习的双学习机制,仅使用单语数据显著提升了零样本翻译性能。该方法在西班牙语-法语翻译任务上实现了接近有监督性能的表现——误差在2.2 BLEU点以内,并在扩展至包括俄语在内的六种语言对时,将零样本方向的性能提升了最高达15.19 BLEU点。

ABSTRACT

Neural Machine Translation (NMT) systems rely on large amounts of parallel data. This is a major challenge for low-resource languages. Building on recent work on unsupervised and semi-supervised methods, we present an approach that combines zero-shot and dual learning. The latter relies on reinforcement learning, to exploit the duality of the machine translation task, and requires only monolingual data for the target language pair. Experiments show that a zero-shot dual system, trained on English-French and English-Spanish, outperforms by large margins a standard NMT system in zero-shot translation performance on Spanish-French (both directions). The zero-shot dual method approaches the performance, within 2.2 BLEU points, of a comparable supervised setting. Our method can obtain improvements also on the setting where a small amount of parallel data for the zero-shot language pair is available. Adding Russian, to extend our experiments to jointly modeling 6 zero-shot translation directions, all directions improve between 4 and 15 BLEU points, again, reaching performance near that of the supervised setting.

研究动机与目标

  • 通过消除对零样本语言对的平行单语数据依赖,解决低资源神经机器翻译中的数据稀缺问题。
  • 通过结合多语言NMT与基于强化学习的双学习机制,提升零样本翻译质量。
  • 实现在无须为零样本对提供平行数据的前提下,可扩展的、单一模型在多个语言方向上的联合训练。
  • 证明即使在零样本对存在少量平行数据的情况下,该方法仍优于标准的零样本NMT。
  • 探究该方法在涵盖俄语等不同语系语言对时的可扩展性与鲁棒性。

提出的方法

  • 采用共享编码器-解码器模型的多语言NMT架构,在多个语言对(如en-fr、en-es)上使用平行单语数据进行训练。
  • 引入一种零样本机制,通过在输入中加入特殊的语言标识符token,实现对未见语言对(如es-fr)的翻译。
  • 应用基于强化学习的双学习机制:将单语句子翻译为目标语言后,再反向翻译回源语言,以流畅度与重构得分作为奖励信号。
  • 定义一个结合语言模型得分(流畅度)与重构误差(后翻译)的奖励函数,通过强化学习优化策略。
  • 仅使用零样本语言对的单语数据进行端到端训练,无需为零样本方向提供任何平行数据。
  • 通过在所有语言对(包括涉及俄语的语言对)上联合训练,将框架扩展至六种语言对(en, es, fr, ru),共享词汇表与单语数据。

实验结果

研究问题

  • RQ1零样本翻译系统是否能在不使用任何零样本语言对平行数据的前提下,实现接近有监督基线的性能?
  • RQ2与标准零样本NMT相比,结合多语言NMT与基于强化学习的双学习机制在多大程度上提升了零样本翻译质量?
  • RQ3该方法在扩展至多个语言对(包括俄语等不同语系)时,其可扩展性如何?
  • RQ4当零样本语言对存在少量平行数据时,该方法是否仍能提升性能?
  • RQ5语言家族多样性与模型容量对零样本双学习框架的泛化能力与性能有何影响?

主要发现

  • 在西班牙语-法语翻译任务上,该零样本双语NMT系统相比标准多语言NMT基线模型,性能最高提升32.58 BLEU点,且该语言对未使用任何平行数据。
  • 该方法在西班牙语-法语翻译任务上实现了与有监督NMT系统仅相差2.2 BLEU点的性能,证明仅使用单语数据即可实现接近有监督的翻译表现。
  • 当为零样本对添加少量平行数据(100万句)时,模型仍比基线NMT模型提升0.67–2.53 BLEU点。
  • 将模型扩展至六种语言对(包括俄语)后,所有零样本方向的性能均提升了4–15.19 BLEU点,且性能始终与有监督基线相差2–3 BLEU点以内。
  • 该模型在多种不同语言对上均表现出一致的性能提升,表明其具备强大的跨语言泛化能力。
  • 即使在翻译至俄语(非印欧语系语言)时,该方法仍保持优异性能,表明其对语言多样性具有强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。