[论文解读] MMTAfrica: Multilingual Machine Translation for African Languages
MMTAfrica 提出首个针对六种非洲语言(丰多语、伊博语、卢旺达语、斯瓦希里语、科萨语和约鲁巴语)及英语和法语的多对多多语言神经机器翻译系统。该研究引入 BT&REC 训练目标,结合反向翻译与重建机制以利用单语数据,在 FLORES 101 基准测试中实现显著的 spBLEU 提升(最高达 +19.46),并发布新的测试集与代码以确保可复现性。
In this paper, we focus on the task of multilingual machine translation for African languages and describe our contribution in the 2021 WMT Shared Task: Large-Scale Multilingual Machine Translation. We introduce MMTAfrica, the first many-to-many multilingual translation system for six African languages: Fon (fon), Igbo (ibo), Kinyarwanda (kin), Swahili/Kiswahili (swa), Xhosa (xho), and Yoruba (yor) and two non-African languages: English (eng) and French (fra). For multilingual translation concerning African languages, we introduce a novel backtranslation and reconstruction objective, BT\&REC, inspired by the random online back translation and T5 modeling framework respectively, to effectively leverage monolingual data. Additionally, we report improvements from MMTAfrica over the FLORES 101 benchmarks (spBLEU gains ranging from $+0.58$ in Swahili to French to $+19.46$ in French to Xhosa). We release our dataset and code source at https://github.com/edaiofficial/mmtafrica.
研究动机与目标
- 为解决非洲语言在多语言机器翻译中代表性不足的问题,特别是低资源环境下的挑战。
- 开发一个支持八种语言之间全部 42 种语言方向的多对多多语言翻译系统,涵盖六种非洲语言。
- 通过新颖的训练目标,有效利用单语数据,提升非洲语言的翻译质量。
- 通过构建新的高度代表性测试集(MMTAfrica 测试集)并报告全面评估结果,建立非洲语言翻译的基准。
提出的方法
- 提出一种新颖的训练目标 BT&REC,结合随机在线反向翻译与 T5 风格的重建机制,以增强单语数据的利用效率。
- 采用基于 T5 的编码器-解码器架构,并通过结合标准翻译任务与重建任务的多目标损失进行微调。
- 在训练过程中采用随机语言选择的反向翻译策略,以模拟未见过的语言对,提升零样本泛化能力。
- 使用共享的多语言分词器,训练单一模型以支持全部 42 种语言方向,实现零样本与少样本翻译。
- 应用数据过滤与筛选策略,确保单语与平行语料的高质量,尤其针对低资源非洲语言。
- 通过并行语料、单语语料与反向翻译相结合的方式训练模型,并在优化过程中动态采样语言对。
实验结果
研究问题
- RQ1在所有 42 种语言方向(包括零样本与少样本设置)中,基于非洲语言训练的多语言神经机器翻译模型是否能实现强大性能?
- RQ2与标准反向翻译或无重建相比,BT&REC 目标在提升低资源非洲语言翻译质量方面的有效性如何?
- RQ3从高资源语言(如英语、法语)进行的迁移学习在多大程度上能泛化到非洲语言对,尤其是同一语系内的语言对?
- RQ4MMTAfrica 在多种非洲语言对上的表现与 M2M 和 FLORES 101 等现有基准相比如何?
- RQ5在特定语言对(如丰多语–约鲁巴语)上的模型表现能揭示哪些语言或结构上的优势?
主要发现
- MMTAfrica 在法语到科萨语方向上相较 M2M 基线实现最高 +19.46 的 spBLEU 提升,表明其在零样本与少样本设置下具备强大泛化能力。
- BT&REC 训练目标在所有语言对上均带来一致改进,提升幅度在 +0.58(斯瓦希里语到法语)至 +19.46(法语到科萨语)之间。
- 该模型在相关语言对(如伊博语–约鲁巴语与丰多语–约鲁巴语)上表现尤为出色,表明语言相似性有助于迁移学习。
- MMTAfrica 测试集作为全新且高度代表性的基准,揭示了不同语言对之间的性能差异显著,以英语和法语为源语言的翻译方向得分更高。
- 在 FLORES 101 评估中,MMTAfrica 在全部 42 种语言方向上均优于 M2M 基线,多个低资源设置下的平均 spBLEU 提升超过 10 分。
- 研究结果表明,从高资源语言进行迁移学习的效果不如从其他非洲语言进行迁移,尤其在同语系内,提示需要采用 AL-to-AL 预训练策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。