Skip to main content
QUICK REVIEW

[论文解读] Universal Conditional Masked Language Pre-training for Neural Machine Translation

Pengfei Li, Liangyou Li|arXiv (Cornell University)|Mar 17, 2022
Natural Language Processing Techniques被引用 4
一句话总结

该论文提出 CeMAT,一种使用双向解码器在大规模单语和双语语料上通过条件掩码语言建模进行预训练的多语言序列到序列模型。它引入了两种新颖的掩码策略——对齐式混语与掩码、动态双重掩码,以增强跨语言表征学习,在低资源设置下实现高达 +14.4 BLEU 的性能提升,平均在自回归 NMT 中提升 +7.9 BLEU,在非自回归 NMT 中提升高达 +5.3 BLEU。

ABSTRACT

Pre-trained sequence-to-sequence models have significantly improved Neural Machine Translation (NMT). Different from prior works where pre-trained models usually adopt an unidirectional decoder, this paper demonstrates that pre-training a sequence-to-sequence model but with a bidirectional decoder can produce notable performance gains for both Autoregressive and Non-autoregressive NMT. Specifically, we propose CeMAT, a conditional masked language model pre-trained on large-scale bilingual and monolingual corpora in many languages. We also introduce two simple but effective methods to enhance the CeMAT, aligned code-switching & masking and dynamic dual-masking. We conduct extensive experiments and show that our CeMAT can achieve significant performance improvement for all scenarios from low- to extremely high-resource languages, i.e., up to +14.4 BLEU on low resource and +7.9 BLEU improvements on average for Autoregressive NMT. For Non-autoregressive NMT, we demonstrate it can also produce consistent performance gains, i.e., up to +5.3 BLEU. To the best of our knowledge, this is the first work to pre-train a unified model for fine-tuning on both NMT tasks. Code, data, and pre-trained models are available at https://github.com/huawei-noah/Pretrained-Language-Model/tree/master/CeMAT.

研究动机与目标

  • 通过使用双向解码器对统一的序列到序列模型进行预训练,而非依赖单向解码器,以提升神经机器翻译(NMT)的性能。
  • 通过提供能更好捕捉表征能力的预训练初始化,缓解非自回归 NMT(NAT)中的性能差距。
  • 通过新颖的掩码策略,实现跨语言与同语言表征学习的增强,使不同语言间的语义对齐。
  • 统一自回归与非自回归 NMT 任务的预训练流程,消除对单独模型初始化的需求。
  • 探究使用条件掩码预训练的双向解码器是否能在生成与表征学习方面优于标准的单向解码器。

提出的方法

  • 提出 CeMAT,一种具备双向编码器、双向解码器以及连接两者的交叉注意力模块的多语言序列到序列模型。
  • 使用单语数据上的掩码语言建模(MLM)和双语数据上的条件掩码语言建模(CMLM)对模型进行预训练。
  • 提出对齐式混语与掩码:将源语句中的词语与其目标语言翻译对齐,随后用其他语言中语义相似的词语替换源词,同时对对应的目标词进行掩码。
  • 应用动态双重掩码策略,通过在训练过程中自适应调整的动态掩码机制,对源语和目标语中剩余的词语进行掩码。
  • 利用涵盖多种语言的大规模单语与双语语料,在统一框架下对模型进行预训练。
  • 直接在自回归与非自回归 NMT 任务上对预训练的 CeMAT 模型进行微调,无需重新初始化。

实验结果

研究问题

  • RQ1在预训练的序列到序列模型中,双向解码器是否能在自回归与非自回归 NMT 中均优于单向解码器?
  • RQ2使用条件掩码对统一模型进行预训练,是否能提升跨语言表征学习与在低资源与高资源语言对上的泛化能力?
  • RQ3对齐式混语与掩码是否能在预训练过程中有效对齐不同语言间的语义表征?
  • RQ4动态双重掩码是否能增强解码器对源端相关上下文的关注能力并提升生成质量?
  • RQ5一个单一的预训练模型是否可作为自回归与非自回归 NMT 的有效初始化,而无需针对任务进行重新初始化?

主要发现

  • 在低资源 NMT 设置下(双语语料对少于 100 万对),CeMAT 相较基线模型性能提升高达 +14.4 BLEU。
  • 在自回归 NMT 中,CeMAT 在多个语言对上平均性能提升高达 +7.9 BLEU,即使在高资源设置下(双语语料对超过 2500 万对)也表现优异。
  • 在非自回归 NMT 中,CeMAT 实现了高达 +5.3 BLEU 的稳定提升,证明其在并行解码场景中的有效性。
  • 在 NAT 的迭代优化过程中,模型展现出更快且更稳定的收敛速度,仅需 3–6 次迭代即可达到峰值性能。
  • 在 WMT16 罗马尼亚语到英语任务中,回译进一步带来 +2.1 BLEU 的性能提升,表明其与数据增强技术具有良好的兼容性。
  • CeMAT 是首个适用于自回归与非自回归 NMT 的统一预训练模型,消除了对独立初始化策略的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。