[论文解读] Cross-lingual Pre-training Based Transfer for Zero-shot Neural Machine Translation
本文提出一种基于跨语言预训练的迁移学习方法,用于零样本神经机器翻译,通过单语和双语预训练训练的通用编码器,对齐源语言和桥接语言的表示。该方法显著提升了基于桥接语言和多语言基线的零样本翻译性能,在零样本翻译中平均比桥接方法高出2.4 BLEU,比多语言NMT高出4.6 BLEU。
Transfer learning between different language pairs has shown its effectiveness for Neural Machine Translation (NMT) in low-resource scenario. However, existing transfer methods involving a common target language are far from success in the extreme scenario of zero-shot translation, due to the language space mismatch problem between transferor (the parent model) and transferee (the child model) on the source side. To address this challenge, we propose an effective transfer learning approach based on cross-lingual pre-training. Our key idea is to make all source languages share the same feature space and thus enable a smooth transition for zero-shot translation. To this end, we introduce one monolingual pre-training method and two bilingual pre-training methods to obtain a universal encoder for different languages. Once the universal encoder is constructed, the parent model built on such encoder is trained with large-scale annotated data and then directly applied in zero-shot translation scenario. Experiments on two public datasets show that our approach significantly outperforms strong pivot-based baseline and various multilingual NMT approaches.
研究动机与目标
- 解决零样本神经机器翻译迁移学习中的语言空间不匹配问题。
- 实现在无平行源-目标语料的情况下,从桥接语言到目标语言的父模型平滑迁移至源语言到目标语言的子模型。
- 构建一个通用编码器,使其在不同源语言和一个桥接语言之间共享不变表示。
- 在保持或提升监督翻译性能的同时,提升零样本翻译性能。
- 探究跨语言预训练在减少源语言之间领域差异方面的有效性。
提出的方法
- 提出一种新颖的双语预训练方法,称为桥接语言建模(BRLM),用于对齐源语言和桥接语言的表示。
- 将单语掩码语言建模(MLM)与BRLM结合,对多种语言的通用编码器进行预训练。
- 采用共享编码器架构,确保不同源语言中语义相同的句子具有相似的潜在表示。
- 在微调过程中应用回译技术,进一步提升零样本翻译质量。
- 在微调过程中采用逐层参数冻结策略,以平衡预训练知识与任务特定适应。
- 在大规模平行语料上训练桥接语言到目标语言的模型,并直接将其应用于源语言到目标语言的翻译,无需额外的平行语料。
实验结果
研究问题
- RQ1跨语言预训练能否有效减少零样本NMT中源语言与桥接语言之间的语言空间不匹配?
- RQ2所提出的BRLM预训练方法是否相比现有方法能更好地提升跨语言句子和词表示的对齐?
- RQ3参数冻结策略在零样本和监督翻译方向上的性能影响如何?
- RQ4通用编码器是否能在无任何源-目标平行语料的情况下实现高质量的零样本翻译?
- RQ5在零样本翻译中,该方法与基于桥接和多语言NMT基线相比表现如何?
主要发现
- 所提出的MLM+BRLM-SA方法在零样本翻译中平均比桥接基线高出2.4 BLEU。
- 在零样本翻译中,MLM+BRLM-SA方法平均比多语言NMT高出4.6 BLEU。
- 冻结前四层编码器层可实现零样本和监督翻译性能的最佳平衡。
- MLM+BRLM-SA方法在所有Transformer层中产生的跨语言句子表示最为稳定且相似,如余弦相似度所测。
- MLM+BRLM-SA方法在词级别隐藏状态上显示出源语言和桥接语言中对齐词之间的更高相似度,表明对齐效果更优。
- 与原始监督Transformer相比,该方法在监督翻译方向上保持或提升了性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。