Skip to main content
QUICK REVIEW

[论文解读] Exploiting Out-of-Domain Parallel Data through Multilingual Transfer Learning for Low-Resource Neural Machine Translation

Aizhan Imankulova, Raj Dabre|arXiv (Cornell University)|Jul 6, 2019
Natural Language Processing Techniques参考文献 26被引用 18
一句话总结

本文提出了一种多语言多阶段微调方法,利用域外平行数据来提升低资源日语-俄语神经机器翻译性能。通过先在多样化域外数据上预训练多语言模型,再在域内平行数据和回译数据上进行微调,该方法在极低资源设置下相比强基线模型实现了 +3.7 BLEU 的性能提升。

ABSTRACT

This paper proposes a novel multilingual multistage fine-tuning approach for low-resource neural machine translation (NMT), taking a challenging Japanese--Russian pair for benchmarking. Although there are many solutions for low-resource scenarios, such as multilingual NMT and back-translation, we have empirically confirmed their limited success when restricted to in-domain data. We therefore propose to exploit out-of-domain data through transfer learning, by using it to first train a multilingual NMT model followed by multistage fine-tuning on in-domain parallel and back-translated pseudo-parallel data. Our approach, which combines domain adaptation, multilingualism, and back-translation, helps improve the translation quality by more than 3.7 BLEU points, over a strong baseline, for this extremely low-resource scenario.

研究动机与目标

  • 为解决低资源神经机器翻译的长期挑战,特别是针对日语-俄语等低资源语言对的问题。
  • 探究在域内数据稀缺的低资源神经机器翻译场景中,域外平行数据是否能被有效利用。
  • 通过在多阶段微调框架中结合多语言预训练、领域适应和回译,提升翻译质量。
  • 证明从多样化域外平行数据进行迁移学习,可在极低资源设置下显著提升性能。

提出的方法

  • 在大规模多语言域外平行数据上预训练一个多语言神经机器翻译模型。
  • 在针对日语-俄语翻译任务的特定域内平行单语数据上微调该多语言模型。
  • 利用目标语言的域内单语句子应用回译,生成伪平行单语数据。
  • 通过依次将模型适应到域内平行数据,再适应到回译生成的伪平行数据,实现多阶段微调。
  • 使用共享的多语言编码器-解码器架构,以在整个训练过程中保持跨语言迁移能力。

实验结果

研究问题

  • RQ1当域内数据极度有限时,域外平行数据是否能提升低资源神经机器翻译性能?
  • RQ2将多语言预训练与特定领域微调相结合,对低资源设置下的翻译质量有何影响?
  • RQ3在多语言多阶段微调流程中,回译的贡献是什么?
  • RQ4所提出的方法是否优于仅依赖域内数据或采用标准多语言NMT的强基线模型?

主要发现

  • 所提方法在低资源日语-俄语翻译任务中,相比强基线模型实现了 +3.7 BLEU 的性能提升。
  • 即使域外平行数据与目标领域不直接对齐,其使用仍显著提升了模型性能。
  • 在域内平行数据和回译数据上进行多阶段微调,比单阶段微调带来了更好的领域适应效果。
  • 与标准方法相比,多语言性、领域适应与回译的结合在低资源设置下取得了更优结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。