[论文解读] Large-scale Pretraining for Neural Machine Translation with Tens of Billions of Sentence Pairs
本文提出在400亿双语句子对上进行大规模预训练,以显著提升神经机器翻译(NMT)性能,通过流水线式预训练与微调策略解决数据噪声和训练效率低下等挑战。该方法在WMT17中文-英文基准上实现了32.3的新SOTA BLEU分数,较之前SOTA方法提升+3.2。
In this paper, we investigate the problem of training neural machine translation (NMT) systems with a dataset of more than 40 billion bilingual sentence pairs, which is larger than the largest dataset to date by orders of magnitude. Unprecedented challenges emerge in this situation compared to previous NMT work, including severe noise in the data and prohibitively long training time. We propose practical solutions to handle these issues and demonstrate that large-scale pretraining significantly improves NMT performance. We are able to push the BLEU score of WMT17 Chinese-English dataset to 32.3, with a significant performance boost of +3.2 over existing state-of-the-art results.
研究动机与目标
- 探究在400亿双语句子对——远超以往数据集规模——的语料上训练NMT系统,是否能显著提升翻译性能。
- 解决大规模NMT训练中前所未有的挑战,包括数据噪声、域外内容以及训练时间过长等问题。
- 评估现有NMT技术(如强化学习、一致重排序和多样化解码)在大规模预训练背景下的有效性。
- 确定在大规模NMT中是否需要进行词分词,尤其是在训练数据极为丰富的情况下。
- 建立一个结合大规模预训练与领域特定微调的实用流程,以实现最佳性能与收敛速度。
提出的方法
- 采用流水线式训练策略:首先在完整的400亿双语数据集上进行预训练,以学习可泛化的表征;随后在特定领域子集上进行微调,以提升适应性与收敛速度。
- 使用子词BPE分词法,词汇表大小为50K,以在覆盖度与OOV率之间取得平衡,避免在大规模设置下使用中文分词。
- 在微调阶段结合多种先进NMT技术:一致重排序(利用从左到右与从右到左生成)、强化学习(RL)以优化BLEU,以及多样化解码以提升n-best列表质量。
- 实施数据过滤与领域感知采样,以减轻大规模训练集中噪声数据与域外内容的影响。
- 采用混合精度训练与分布式数据并行技术,以控制计算成本并提升训练速度。
- 使用标准的WMT17中文-英文基准指标评估模型性能,重点关注BLEU分数,以及数据规模与模型架构的消融研究。
实验结果
研究问题
- RQ1在400亿双语句子对上训练NMT模型,是否能显著超越现有SOTA系统?
- RQ2在400亿规模的双语数据集中,如何有效缓解数据噪声与域外内容的影响?
- RQ3在大规模NMT训练中,全数据集预训练与收敛速度之间存在何种最优权衡?
- RQ4在大规模场景下,如回译与单语语言模型融合等成熟NMT技术是否仍有效,还是会导致性能下降?
- RQ5在训练数据极为丰富的前提下,中文分词是否在大规模NMT中仍为必要?
主要发现
- 所提出的大型规模预训练与微调流水线在WMT17中文-英文翻译基准上实现了32.3的新SOTA BLEU分数,较之前SOTA结果提升+3.2。
- 在完整400亿数据集上进行预训练,随后进行领域特定微调,性能显著优于仅进行预训练(28.7 BLEU vs. 24.7 BLEU),证明了两阶段方法的有效性。
- 当应用于在400亿数据上预训练的模型时,单语数据增强技术(如语言模型融合与回译)反而损害性能,可能源于数据规模不匹配。
- 一致重排序、强化学习与多样化解码各自带来增量提升,三者结合可实现最高BLEU分数32.29。
- 基于字符的模型在基础架构中表现最佳(30.1 BLEU),优于基于词(29.4)与BPE(29.8)的模型,表明子词或字符级分词在大规模场景下更具优势。
- 本研究证实,当训练数据足够丰富时,中文分词在大规模NMT中并非必需,使用BPE或字符级分词的模型性能优于基于词的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。