Skip to main content
QUICK REVIEW

[论文解读] Facebook AI WMT21 News Translation Task Submission

Chau Tran, Shruti Bhosale|arXiv (Cornell University)|Aug 6, 2021
Natural Language Processing Techniques被引用 9
一句话总结

Facebook AI 提出了一种多语言神经机器翻译系统,支持14种语言方向,利用大规模回译、多语言数据挖掘、密集与稀疏专家混合(MoE)架构、领域内微调以及噪声信道重排序。该系统在WMT2020胜者的基础上实现了平均+2.0 BLEU的提升,并在10个方向上排名第一,表明多语言模型在高资源与低资源设置下均能超越双语基线模型。

ABSTRACT

We describe Facebook's multilingual model submission to the WMT2021 shared task on news translation. We participate in 14 language directions: English to and from Czech, German, Hausa, Icelandic, Japanese, Russian, and Chinese. To develop systems covering all these directions, we focus on multilingual models. We utilize data from all available sources --- WMT, large-scale data mining, and in-domain backtranslation --- to create high quality bilingual and multilingual baselines. Subsequently, we investigate strategies for scaling multilingual model size, such that one system has sufficient capacity for high quality representations of all eight languages. Our final submission is an ensemble of dense and sparse Mixture-of-Expert multilingual translation models, followed by finetuning on in-domain news data and noisy channel reranking. Compared to previous year's winning submissions, our multilingual system improved the translation quality on all language directions, with an average improvement of 2.0 BLEU. In the WMT2021 task, our system ranks first in 10 directions based on automatic evaluation.

研究动机与目标

  • 证明多语言翻译模型可在多种语言对上超越双语基线模型的翻译质量。
  • 研究数据规模、模型架构和训练技术对多语言翻译性能的影响。
  • 评估回译、领域内微调和集成在多语言设置下的有效性。
  • 开发一个统一的多语言系统,在高资源与低资源语言中均实现最先进性能。
  • 量化数据挖掘、MoE 扩展和重排序等技术对最终翻译质量的累积影响。

提出的方法

  • 使用 WMT、ccMatrix、ccAligned、OPUS 和挖掘的双语语料数据,在14种语言方向上联合训练多语言模型。
  • 利用来自 Commoncrawl 的单语数据进行大规模回译,通过n-gram语言模型相似性筛选出新闻领域数据。
  • 采用多语言子词分词器,并训练包含最多128个专家和24/24个模型头的密集与稀疏专家混合(MoE)模型。
  • 在新闻领域数据上进行领域内微调,以纠正回译导致的翻译语体(translationese)过拟合问题。
  • 应用噪声信道重排序以提升输出流畅度和BLEU分数。
  • 实施语言特定的后处理以标准化标点符号,尤其对中文及其他书写系统至关重要。

实验结果

研究问题

  • RQ1单一多语言模型是否能在多种语言对上实现优于双语模型的翻译质量?
  • RQ2回译对多语言模型有何影响,特别是在可能引入翻译语体的高资源设置中?
  • RQ3领域内微调在多大程度上能纠正回译引起的分布偏移问题?
  • RQ4模型扩展、MoE 架构和集成对多语言翻译性能的贡献如何?
  • RQ5数据挖掘、单语数据过滤和后处理如何共同影响最终的BLEU分数?

主要发现

  • 该多语言系统在全部14种语言方向上,平均比WMT2020胜出模型提升+2.0 BLEU。
  • 在自动评估中,该系统在14种语言方向中的10个方向排名第一,尤其在Hausa和冰岛语等低资源语言对中提升最大。
  • 领域内微调减少了翻译语体的负面影响,使中文-英语和捷克语-英语等高资源方向的BLEU最高提升+0.4。
  • 针对中文的标准化标点后处理使BLEU提升接近+5,凸显其在评分中的关键作用。
  • MoE-128 24/24 架构表现最强,表明多语言模型从扩展中获益的程度高于双语模型。
  • 集成与重排序带来了增量提升,其中重排序使平均BLEU提升0.3–0.5,尤其在低资源设置中效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。