Skip to main content
QUICK REVIEW

[论文解读] Tencent's Multilingual Machine Translation System for WMT22 Large-Scale African Languages

Wenxiang Jiao, Zhaopeng Tu|arXiv (Cornell University)|Oct 18, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文介绍了腾讯在WMT22大规模非洲语言多语种机器翻译共享任务中提出的多语种神经机器翻译系统,通过数据增强、分布鲁棒优化(DRO)和语言家族分组,解决了数据稀缺、数据不平衡以及多语种化难题。该系统在盲测集上取得17.95的BLEU分数,排名第一,显著优于基线模型。

ABSTRACT

This paper describes Tencent's multilingual machine translation systems for the WMT22 shared task on Large-Scale Machine Translation Evaluation for African Languages. We participated in the $\mathbf{constrained}$ translation track in which only the data and pretrained models provided by the organizer are allowed. The task is challenging due to three problems, including the absence of training data for some to-be-evaluated language pairs, the uneven optimization of language pairs caused by data imbalance, and the curse of multilinguality. To address these problems, we adopt data augmentation, distributionally robust optimization, and language family grouping, respectively, to develop our multilingual neural machine translation (MNMT) models. Our submissions won the $\mathbf{1st\ place}$ on the blind test sets in terms of the automatic evaluation metrics. Codes, models, and detailed competition results are available at https://github.com/wxjiao/WMT2022-Large-Scale-African.

研究动机与目标

  • 解决WMT22大规模多语种翻译任务中某些非洲语种对缺乏平行训练数据的问题。
  • 缓解因不同非洲语种对之间数据不平衡导致的性能下降问题。
  • 缓解多语种神经机器翻译(MNMT)模型在处理数百种语种对时面临的多语种化困境。
  • 在仅使用官方数据和预训练模型的受限训练条件下,构建一个稳健且可扩展的MNMT系统。

提出的方法

  • 通过添加特殊标记的回译和自训练方法,生成无平行单语或双语数据的低资源语种对的合成平行数据。
  • 采用分布鲁棒优化(DRO)方法,在所有翻译方向上平衡模型优化,尤其提升了英语和法语等主导语言的性能。
  • 通过语言家族分组(LFG)技术,将语言聚类为家族(如班图语系、尼罗-撒哈拉语系),并为每个家族训练独立模型,以减少无关语种对之间的干扰。
  • 采用两阶段训练流程:首先在大规模数据(Large-234)上进行预训练,然后在更清洁的小型数据集(Base-146 和 Eval-106)上进行微调,以避免合成数据中的错误传播。
  • 在编码器中引入目标语种标签以增强零样本迁移能力,但在多中心语种设置下未带来显著性能提升。
  • 通过消融实验评估各组件的有效性,包括持续训练、微调和模型缩放。

实验结果

研究问题

  • RQ1数据增强技术是否能有效提升无可用平行数据的低资源非洲语种对的翻译性能?
  • RQ2在多语种设置下,分布鲁棒优化(DRO)在多大程度上能平衡高资源与低资源语种对之间的模型性能?
  • RQ3语言家族分组在减少干扰并提升包含数百种语种对的多语种NMT模型翻译质量方面有多有效?
  • RQ4在多中心语种MNMT设置中,增加模型容量或应用目标语种标签是否能提升性能?

主要发现

  • 所提系统在盲测集上取得17.95的BLEU分数,较基线模型(15.50 BLEU)高出2.45分。
  • 通过回译和自训练进行数据增强,在用于模型预训练时提升了性能,但直接在合成数据上训练反而因错误传播导致性能下降。
  • 分布鲁棒优化(DRO)显著提升了所有语种对的性能,尤其在英语和法语等主导语言上收益明显。
  • 语言家族分组(LFG)在一对多翻译方向上取得了最大提升,证明其在缓解多语种化困境方面的有效性。
  • 在更小、更清洁的数据集(Eval-106)上进行微调优于在更大、更嘈杂的数据集(Large-234)上直接微调,表明在多语种训练中数据质量优于数量。
  • 采用语言家族分组与DRO的模型达到最高性能(17.95 BLEU),在官方WMT22受限翻译赛道中荣获第一名。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。