Skip to main content
QUICK REVIEW

[论文解读] A Simple Baseline to Semi-Supervised Domain Adaptation for Machine Translation

Di Jin, Zhijing Jin|arXiv (Cornell University)|Jan 22, 2020
Natural Language Processing Techniques参考文献 21被引用 13
一句话总结

本文提出了一种简单但极为有效的迭代反向翻译与语言建模方法,用于神经机器翻译(NMT)中的半监督领域自适应,每次训练迭代中均整合了监督的源领域数据。该方法在最强基线上实现了最高+19.31 BLEU的提升,在未自适应模型上实现了+47.69 BLEU的提升,为未来研究建立了一个强大且易于实现的基线。

ABSTRACT

State-of-the-art neural machine translation (NMT) systems are data-hungry and perform poorly on new domains with no supervised data. As data collection is expensive and infeasible in many cases, domain adaptation methods are needed. In this work, we propose a simple but effect approach to the semi-supervised domain adaptation scenario of NMT, where the aim is to improve the performance of a translation model on the target domain consisting of only non-parallel data with the help of supervised source domain data. This approach iteratively trains a Transformer-based NMT model via three training objectives: language modeling, back-translation, and supervised translation. We evaluate this method on two adaptation settings: adaptation between specific domains and adaptation from a general domain to specific domains, and on two language pairs: German to English and Romanian to English. With substantial performance improvement achieved---up to +19.31 BLEU over the strongest baseline, and +47.69 BLEU improvement over the unadapted model---we present this method as a simple but tough-to-beat baseline in the field of semi-supervised domain adaptation for NMT.

研究动机与目标

  • 解决在缺乏平行训练数据的低资源、专业领域中NMT性能不佳的挑战。
  • 通过仅使用单语数据,提升从高资源源领域(如WMT)到目标领域的模型泛化能力。
  • 开发一种简单但强大的半监督NMT领域自适应基线方法,优于现有方法。
  • 研究数据量与数据分布对适应性能的影响,特别是在低资源设置下的表现。

提出的方法

  • 通过在大规模单语维基百科数据上进行语言建模预训练,初始化基于Transformer的NMT模型,涵盖源语言和目标语言。
  • 通过三个目标迭代训练模型:双向反向翻译(L1→L2 和 L2→L1)、在目标领域单语数据上的语言建模,以及在源领域平行数据上的监督翻译。
  • 采用迭代优化策略,每个训练步骤在非平行目标数据上的反向翻译与语言建模之间交替进行,并定期在源领域平行数据上进行微调。
  • 通过将目标领域单语数据与同一领域或源领域的额外非平行数据相结合,实现数据增强,以提升性能。
  • 实施多目标训练方案,联合优化翻译质量、单语流畅性与领域泛化能力。
  • 应用子采样与数据组合策略,分析源领域数据规模与分布对模型性能的影响。

实验结果

研究问题

  • RQ1将迭代反向翻译与在单语目标数据上的语言建模相结合,是否能显著提升低资源领域中的NMT性能?
  • RQ2在迭代训练中引入监督的源领域数据,相较于纯无监督方法,对适应性能有何影响?
  • RQ3从目标领域或源领域获取的额外非平行单语数据对适应性能有何影响?
  • RQ4源领域平行数据的规模如何影响领域自适应中的性能增益?
  • RQ5所提出的方法是否能作为强大且简单的基线,优于现有半监督领域自适应的最先进方法?

主要发现

  • 在特定领域之间的领域自适应中,该方法相较于四个基线模型中的最强者,最高实现了+9.48 BLEU的性能提升。
  • 从通用领域(WMT)自适应到特定领域时,该方法在最佳先前方法基础上实现了最高+19.31 BLEU的提升,在未自适应模型基础上实现了+47.69 BLEU的提升。
  • 在目标领域(如TED演讲)中添加额外的非平行数据可一致提升性能,最佳设置下的BLEU分数已非常接近监督翻译性能。
  • 该方法的性能随源领域平行数据的增加而提升,仅在数据量超过100万平行句对时趋于饱和。
  • IBT+Back方法始终优于所有基线,包括仅使用反向翻译或数据有限的方法,展现出更优的数据效率与泛化能力。
  • 该方法表现出强大的鲁棒性与可扩展性,在两种语言对(德语-英语与罗马尼亚语-英语)及多种自适应设置中均保持性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。