Skip to main content
QUICK REVIEW

[论文解读] Back-translation for Large-Scale Multilingual Machine Translation

Baohao Liao, Shahram Khadivi|arXiv (Cornell University)|Sep 17, 2021
Natural Language Processing Techniques参考文献 16被引用 4
一句话总结

本文提出一种基于约束采样的回译方法,用于大规模多语言神经机器翻译,表明较小的词表和经过筛选的单语英语数据可提升性能。通过在约束采样生成的合成数据上迭代微调一个12亿参数模型,该方法在WMT-21小型任务中分别取得34.96和33.34的平均spBLEU得分,位列第二。

ABSTRACT

This paper illustrates our approach to the shared task on large-scale multilingual machine translation in the sixth conference on machine translation (WMT-21). This work aims to build a single multilingual translation system with a hypothesis that a universal cross-language representation leads to better multilingual translation performance. We extend the exploration of different back-translation methods from bilingual translation to multilingual translation. Better performance is obtained by the constrained sampling method, which is different from the finding of the bilingual translation. Besides, we also explore the effect of vocabularies and the amount of synthetic data. Surprisingly, the smaller size of vocabularies perform better, and the extensive monolingual English data offers a modest improvement. We submitted to both the small tasks and achieved the second place.

研究动机与目标

  • 在低资源环境下,利用回译技术提升多语言神经机器翻译性能。
  • 探究不同回译采样策略(束搜索、无约束采样与约束采样)在多语言场景下的影响。
  • 评估词表大小与合成单语数据量对翻译质量的影响。
  • 优化模型训练与数据筛选,实现在资源受限条件下的高效部署。
  • 在大规模多语言翻译任务中实现高性能表现,尤其针对低资源语言对。

提出的方法

  • 采用在并行单语和并行训练数据上微调的多语言Transformer模型,使用12亿参数模型(Trans_big)生成合成数据。
  • 应用约束采样生成合成源语句,将词预测限制在高概率候选词范围内,以提升多样性和质量。
  • 使用温度缩放(T=5)通过基于句数调整采样权重,平衡低资源语言之间的数据分布。
  • 将合成数据限制在250个词以内且源语-目标语长度比小于1.8,以维持质量与连贯性。
  • 执行迭代微调:首先在并行数据上微调Trans_base,然后用其生成合成数据,再在合并数据上进行第二次微调。
  • 谨慎选择单语英语数据,仅使用600万条句子用于合成数据生成,因为超过该阈值后收益递减。

实验结果

研究问题

  • RQ1不同回译采样方法(束搜索、无约束采样与约束采样)如何影响多语言翻译性能?
  • RQ2减少词表大小是否能提升多语言翻译质量,尤其是在低资源设置下?
  • RQ3在多语言系统中,回译的最优单语英语数据量是多少?
  • RQ4语言间的相似性(如中欧/东欧语言与东南亚语言)如何影响回译的有效性?
  • RQ5能否通过大规模预训练模型生成的高质量合成数据,提升小规模低资源翻译任务的性能?

主要发现

  • 在多语言回译中,约束采样优于束搜索与无约束采样,这与双语设置下的发现相反。
  • 较小的词表(128K)比更大的词表(256K)表现更优,表明其具有更好的泛化能力并减少了噪声。
  • 使用超过600万条单语英语句子仅带来微小提升,表明该阈值后收益递减。
  • 约束采样方法降低了在语言相似的多语言设置中生成混合语言合成句子的风险。
  • 在12亿参数大模型生成的合成数据上进行迭代微调,在Small Task 2的开发测试集上达到33.01的spBLEU得分。
  • 最终提交在WMT-21两个小型任务中均位列第二,分别在Hidden Test Set上取得34.96和33.34的平均spBLEU得分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。