Skip to main content
QUICK REVIEW

[论文解读] Improving Zero-Shot Translation of Low-Resource Languages

Surafel M. Lakew, Quintino F. Lotito|arXiv (Cornell University)|Nov 4, 2018
Natural Language Processing Techniques参考文献 21被引用 21
一句话总结

本文提出一种迭代自训练方法,通过在模型自身生成的翻译上重新训练模型,提升低资源多语言神经机器翻译中的零样本翻译性能,相较于基线多语言模型提升9 BLEU分,且优于基于回译的翻译方法。该方法通过双语翻译循环生成逐步更清洁的合成平行语料,从而提升零样本及非零样本翻译方向的性能。

ABSTRACT

Recent work on multilingual neural machine translation reported competitive performance with respect to bilingual models and surprisingly good performance even on (zeroshot) translation directions not observed at training time. We investigate here a zero-shot translation in a particularly lowresource multilingual setting. We propose a simple iterative training procedure that leverages a duality of translations directly generated by the system for the zero-shot directions. The translations produced by the system (sub-optimal since they contain mixed language from the shared vocabulary), are then used together with the original parallel data to feed and iteratively re-train the multilingual network. Over time, this allows the system to learn from its own generated and increasingly better output. Our approach shows to be effective in improving the two zero-shot directions of our multilingual model. In particular, we observed gains of about 9 BLEU points over a baseline multilingual model and up to 2.08 BLEU over a pivoting mechanism using two bilingual models. Further analysis shows that there is also a slight improvement in the non-zero-shot language directions.

研究动机与目标

  • 解决多语言神经机器翻译(NMT)场景中某些语料对缺乏平行语料的低资源语言翻译挑战。
  • 在不依赖额外平行单语语料的前提下,提升零样本翻译性能,特别是像意大利语-罗马尼亚语这类低资源语言对的表现。
  • 探究多语言NMT模型是否可通过利用其自生成输出作为合成训练数据,实现对自身零样本翻译质量的迭代改进。
  • 评估该自校正过程是否不仅能提升零样本翻译方向,也能改善非零样本翻译方向的性能。

提出的方法

  • 该方法采用迭代的训练-推理-再训练循环:首先,多语言NMT模型在训练数据子集上生成零样本翻译。
  • 随后,将生成的翻译与原始平行语料结合,用于模型的再训练,每次迭代仅使用最新一批合成数据。
  • 模型通过目标强制机制初始化,即在输入前添加语言标识符以指定目标语言,从而在推理时支持零样本翻译。
  • 该过程重复多轮,使模型能逐步从日益准确的自生成翻译中学习。
  • 该方法利用翻译的对偶性:通过生成源语言到目标语言及目标语言到源语言的双向翻译,构建一致的合成平行语料。
  • 该训练流程应用于包含意大利语、罗马尼亚语、英语、德语和荷兰语的多语言设置中,仅英语作为中转语言。

实验结果

研究问题

  • RQ1多语言NMT模型是否能通过在自身生成的翻译上迭代再训练,显著提升其零样本翻译性能?
  • RQ2自校正过程是否在后续迭代中使翻译结果更清晰、更一致,尤其是在低资源设置下?
  • RQ3所提出的方法在提升零样本翻译方向的同时,对非零样本翻译方向的性能提升程度如何?
  • RQ4与使用两个双语模型的基于回译的翻译方法相比,该迭代自训练方法在BLEU分数和翻译质量方面表现如何?

主要发现

  • 所提方法在意大利语-罗马尼亚语零样本翻译方向上,相较于基线多语言NMT模型,实现了显著的+9 BLEU分提升。
  • 在相同零样本方向上,该方法比使用两个双语模型的回译机制最高提升2.08 BLEU分。
  • 模型在多个测试集上均表现出一致增益,包括在IWSLT 2017测试集上分别提升+8.9和+10.67 BLEU分,证实了其鲁棒性。
  • 即使非零样本方向也获得了性能提升,仅在荷兰语→英语方向观察到-0.10 BLEU的轻微下降,表明方法具备良好的泛化能力。
  • 定性分析表明,增强后的模型(Multi-NMT*)生成的输出在目标语言上更加一致,消除了基线模型中存在的混合语言错误。
  • 最大的性能提升出现在第一轮再训练之后,表明初始合成数据已提供显著信号,后续轮次进一步优化了模型性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。