Skip to main content
QUICK REVIEW

[论文解读] Multi-Task Learning with Shared Encoder for Non-Autoregressive Machine Translation

Yongchang Hao, Shilin He|arXiv (Cornell University)|Oct 24, 2020
Natural Language Processing Techniques参考文献 44被引用 8
一句话总结

本文提出一种具有共享编码器的多任务学习框架,通过从自回归(AT)模型迁移知识来提升非自回归(NAT)机器翻译性能。通过联合训练NAT与AT模型,并采用动态退火的AT损失权重,该方法在WMT14、WMT16、WMT19和WMT20的英语-德语及英语-罗马尼亚语翻译任务上,显著超越强基线NAT模型,且与知识蒸馏方法具有互补性。

ABSTRACT

Non-Autoregressive machine Translation (NAT) models have demonstrated significant inference speedup but suffer from inferior translation accuracy. The common practice to tackle the problem is transferring the Autoregressive machine Translation (AT) knowledge to NAT models, e.g., with knowledge distillation. In this work, we hypothesize and empirically verify that AT and NAT encoders capture different linguistic properties of source sentences. Therefore, we propose to adopt Multi-Task learning to transfer the AT knowledge to NAT models through encoder sharing. Specifically, we take the AT model as an auxiliary task to enhance NAT model performance. Experimental results on WMT14 English-German and WMT16 English-Romanian datasets show that the proposed Multi-Task NAT achieves significant improvements over the baseline NAT models. Furthermore, the performance on large-scale WMT19 and WMT20 English-German datasets confirm the consistency of our proposed method. In addition, experimental results demonstrate that our Multi-Task NAT is complementary to knowledge distillation, the standard knowledge transfer method for NAT.

研究动机与目标

  • 为解决非自回归(NAT)与自回归(AT)机器翻译模型之间的性能差距,通过从AT模型向NAT模型迁移语言知识。
  • 探究AT与NAT编码器是否从同一源句中学习到不同的语言属性,从而实现互补性知识迁移。
  • 设计一种具有共享编码器和动态损失加权的多任务学习框架,以提升NAT性能,同时不牺牲推理速度。
  • 在包括WMT14、WMT16、WMT19和WMT20在内的多样化、大规模翻译基准上,评估所提方法的有效性与泛化能力。

提出的方法

  • 提出一种多任务学习框架,其中NAT与AT模型共享同一编码器,同时保持独立的解码器。
  • AT模型作为辅助任务,通过共享表示学习提升NAT性能。
  • 采用一种称为“重要性退火”的动态损失加权策略,训练过程中将AT损失权重从1逐步降低至0,以平衡任务贡献。
  • 通过是否使用知识蒸馏来评估该方法与标准知识迁移技术的互补性。
  • 使用探针任务分析共享编码器所学习的语言表示,比较AT与NAT模型在表层、句法和语义属性上的表现。
  • 在使用Transformer和Mask-Predict架构的WMT14、WMT16、WMT19和WMT20英语-德语及英语-罗马尼亚语翻译数据集上进行实验。

实验结果

研究问题

  • RQ1AT与NAT编码器是否从同一源句中学习到不同的语言属性?
  • RQ2共享编码器的多任务学习能否有效实现从AT到NAT模型的知识迁移,从而提升翻译质量?
  • RQ3与固定加权策略相比,所提出的“重要性退火”策略是否能提升多任务学习性能?
  • RQ4所提方法与知识蒸馏相比如何?是否可与之结合使用?
  • RQ5所提方法的性能增益在不同规模和语言对上是否具有一致性?

主要发现

  • 在WMT14数据集上,所提出的多任务NAT模型在En→De方向相比Mask-Predict基线提升0.96 BLEU点,在De→En方向提升0.57 BLEU点。
  • 采用重要性退火策略后,模型在性能上持续优于基线多任务模型,证明了动态损失加权的有效性。
  • 在WMT16英语-罗马尼亚语数据集上,模型在En→Ro方向和Ro→En方向分别优于基线0.77和0.89 BLEU点。
  • 在大规模的WMT19和WMT20英语-德语数据集上,模型在En→De翻译任务中分别比基线提升0.58和0.22 BLEU点。
  • 探针任务显示,共享编码器所捕获的表层、句法和语义信息优于独立的AT或NAT模型,尤其在句子长度和树深度预测任务上取得显著提升。
  • 当与知识蒸馏结合时,模型表现出互补性增益,在WMT14 En→De翻译任务中相比Mask-Predict基线提升0.80 BLEU点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。