Skip to main content
QUICK REVIEW

[论文解读] Knowledge Distillation for Multilingual Unsupervised Neural Machine Translation

Haipeng Sun, Rui Wang|arXiv (Cornell University)|Apr 21, 2020
Natural Language Processing Techniques参考文献 39被引用 6
一句话总结

本文提出了一种统一的多语言无监督神经机器翻译(MUNMT)框架,采用单一编码器和解码器,在13种语言之间进行翻译,利用多语言单语数据以及两种新颖的知识蒸馏方法——自知识蒸馏和语言分支知识蒸馏。该方法在所有语言对上均实现了最先进性能,显著提升了零样本翻译和低资源语言对的表现,同时超越了强大的独立无监督基线模型。

ABSTRACT

Unsupervised neural machine translation (UNMT) has recently achieved remarkable results for several language pairs. However, it can only translate between a single language pair and cannot produce translation results for multiple language pairs at the same time. That is, research on multilingual UNMT has been limited. In this paper, we empirically introduce a simple method to translate between thirteen languages using a single encoder and a single decoder, making use of multilingual data to improve UNMT for all language pairs. On the basis of the empirical findings, we propose two knowledge distillation methods to further enhance multilingual UNMT performance. Our experiments on a dataset with English translated to and from twelve other languages (including three language families and six language branches) show remarkable results, surpassing strong unsupervised individual baselines while achieving promising performance between non-English language pairs in zero-shot translation scenarios and alleviating poor performance in low-resource language pairs.

研究动机与目标

  • 解决现有无监督NMT系统仅能一次翻译一对语言的局限性。
  • 通过单一模型架构在不同语系和语族之间实现高效、可扩展的多语言翻译。
  • 通过知识蒸馏提升零样本翻译和低资源语言对的性能。
  • 探索语言结构感知蒸馏在多语言无监督翻译中的有效性。
  • 通过统一框架建立大规模多语言无监督NMT的强基线。

提出的方法

  • 设计了一种统一的MUNMT框架,采用单一共享编码器和单一解码器,利用单语数据在13种语言上进行联合训练。
  • 通过跨语言掩码语言模型预训练,使编码器在不同语言间初始化共享的潜在表征。
  • 应用去噪自编码以提高鲁棒性,通过在同种语言中重建被破坏的输入句子。
  • 通过迭代式后翻译生成伪平行数据,利用自训练提升翻译质量。
  • 提出两种知识蒸馏方法:自知识蒸馏使用模型自身的预测作为软目标,语言分支知识蒸馏则结合语言分支间的语言相似性以指导蒸馏过程。
  • 将蒸馏目标整合进训练损失,利用更强的教师信号优化学生模型的预测。

实验结果

研究问题

  • RQ1单一编码器、单一解码器架构能否有效支持13种不同欧洲语言的多语言无监督翻译?
  • RQ2知识蒸馏在多语言无监督NMT中如何提升性能,特别是在零样本和低资源翻译场景下?
  • RQ3语言分支之间的语言相似性在多语言NMT知识蒸馏中在多大程度上能带来增益?
  • RQ4所提出的统一MUNMT框架是否在所有语言对上均优于强大的独立无监督基线模型?
  • RQ5通过统一框架整合多语言单语数据,能否缓解低资源语言对中的性能下降问题?

主要发现

  • 所提出的MUNMT系统在13种语言上实现了最先进性能,在所有语言对上均超越了强大的独立无监督基线模型。
  • 在非英语到英语翻译的平均BLEU得分达到21.19,显著优于基线模型。
  • 在零样本翻译中,模型表现令人鼓舞,尤其在低资源语言对如拉脱维亚语(Lv-En)和立陶宛语(Lt-En)上,微调后BLEU得分从1.72提升至16.86。
  • 语言分支知识蒸馏在相关语言对中带来显著提升,例如罗马尼亚语(Ro-En)和土耳其语(Tr-En)分别提升了1.5 BLEU。
  • 自知识蒸馏提升了泛化能力,最终的MUNMT模型在平均BLEU上达到21.19,较基线提升1.72分。
  • 在非英语到英语对上进一步微调后,性能提升至21.19 BLEU,证明了模型的适应性和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。