[论文解读] Multilingual Machine Translation Systems from Microsoft for WMT21 Shared Task
本文介绍了微软在WMT21共享任务中提出的多语言机器翻译系统,该系统基于预训练的DeltaLM-Large模型,利用大规模多语言数据进行微调,并应用渐进式学习与迭代回译技术以提升性能。该系统在自动评估指标上取得了最先进结果,在全部三个评估赛道中均排名第一。
This report describes Microsoft's machine translation systems for the WMT21 shared task on large-scale multilingual machine translation. We participated in all three evaluation tracks including Large Track and two Small Tracks where the former one is unconstrained and the latter two are fully constrained. Our model submissions to the shared task were initialized with DeltaLM\footnote{\url{https://aka.ms/deltalm}}, a generic pre-trained multilingual encoder-decoder model, and fine-tuned correspondingly with the vast collected parallel data and allowed data sources according to track settings, together with applying progressive learning and iterative back-translation approaches to further improve the performance. Our final submissions ranked first on three tracks in terms of the automatic evaluation metric.
研究动机与目标
- 使用大规模多语言数据开发一个高性能的多语言机器翻译系统,用于WMT21共享任务。
- 探究渐进式微调与迭代回译在提升多语言翻译性能方面的有效性。
- 探索像DeltaLM这样的预训练多语言模型在零样本与低资源翻译方向上的影响。
- 在计算资源受限的条件下,优化模型容量与训练效率。
- 在无约束与完全约束的评估赛道中均实现顶尖性能。
提出的方法
- 系统以公开的DeltaLM-Large预训练编码器-解码器模型为初始化,基于来自CCAligned、OPUS-100及内部数据等多种来源的大规模多语言平行语料进行微调。
- 通过渐进式学习策略,先训练一个包含24个编码器层的浅层模型,随后通过增加12个新层,将其扩展为包含36个编码器层的深层模型。
- 采用迭代回译技术生成合成平行语料,对单语数据进行多轮回译,以提升数据质量与覆盖范围。
- 通过将同一组英文单语句子翻译成多种目标语言,构建双伪平行语料,提升非英语方向的数据多样性。
- 在Small Track #2中采用混合翻译策略:若直接翻译优于基于英语的枢纽翻译,则选择直接翻译;否则采用枢纽翻译。
- 模型选择在推理速度与性能之间取得平衡,向Large Track和Small Track #2提交了24层编码器模型,向Small Track #1提交了36层模型。
实验结果
研究问题
- RQ1DeltaLM-Large预训练模型在大规模设置下作为多语言翻译基础模型的效果如何?
- RQ2从浅层架构扩展到深层架构时,渐进式学习在多大程度上能提升模型性能?
- RQ3迭代回译是否能显著提升翻译质量,特别是对低资源语言对?
- RQ4双伪数据生成在多语言翻译中如何提升性能,特别是在非英语语言方向上的表现?
- RQ5在低资源翻译方向数据不平衡的情况下,最优策略是直接翻译还是基于枢纽的翻译?
主要发现
- 最终系统(DeltaLM + Zcode)在Large Track上取得了16.63的BLEU分数,位列所有提交结果中的第一名。
- 在Small Track #1中,系统取得了37.59的BLEU分数,是该赛道所有参赛系统中的最高分。
- 在Small Track #2中,系统获得33.89的BLEU分数,尽管训练数据更小且分布更不均衡,仍稳居榜首。
- 消融实验表明,每个组件——渐进式学习、数据选择与模型深度——均贡献显著,完整系统(①)相比基线模型提升了+9.41 BLEU分。
- Small Track #2中的混合策略相比仅使用直接翻译或仅使用枢纽翻译的方法,性能提升了约+0.5 BLEU分,证实其在数据不平衡情况下的有效性。
- 深层模型(36个编码器层)在性能上与浅层模型(24个编码器层)相当,表明尽管参数容量增加,但在低资源方向上仍可能存在过拟合现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。