[论文解读] Improving Non-autoregressive Neural Machine Translation with Monolingual Data
本文提出利用大规模单语语料库,通过预训练的自回归(AR)教师模型生成额外的训练数据,以改进非自回归神经机器翻译(NAR-NMT)。通过在NAR训练数据中加入单语句子,该方法减少了过拟合,提升了泛化能力——尤其在长句上表现更优,并在WMT14 En-De和WMT16 En-Ro基准上实现了最先进性能,将BLEU分数与AR教师模型的差距缩小至仅0.11分。
Non-autoregressive (NAR) neural machine translation is usually done via knowledge distillation from an autoregressive (AR) model. Under this framework, we leverage large monolingual corpora to improve the NAR model's performance, with the goal of transferring the AR model's generalization ability while preventing overfitting. On top of a strong NAR baseline, our experimental results on the WMT14 En-De and WMT16 En-Ro news translation tasks confirm that monolingual data augmentation consistently improves the performance of the NAR model to approach the teacher AR model's performance, yields comparable or better results than the best non-iterative NAR methods in the literature and helps reduce overfitting in the training process.
研究动机与目标
- 通过利用大规模单语语料库来增强模型泛化能力,以改进非自回归神经机器翻译(NAR-NMT)。
- 通过增加训练数据的多样性,减少NAR模型在训练过程中,尤其是在长句上的过拟合。
- 通过使用单语数据增强知识蒸馏,缩小NAR与自回归(AR)模型之间的性能差距。
- 在标准WMT翻译基准上,实现非迭代NAR方法中的最先进结果。
提出的方法
- 该方法使用预训练的自回归(AR)模型,从单语源句中生成合成的目标翻译,以扩展NAR的训练数据。
- 采用基于高斯核的软拷贝机制,将源上下文注入解码器输入,替代传统的硬拷贝方式。
- 通过移除未来标记的掩码机制,修改解码器以同时关注过去和未来标记,从而实现使用完整上下文的非自回归生成。
- 在每个解码器层添加位置嵌入,而非使用额外的位置注意力模块,以保持与基础Transformer的一致性与简洁性。
- 通过基于候选的长度预测方法实现长度预测,即生成多个目标长度并由AR教师模型对它们进行排序。
- 利用单语数据生成额外的训练样本,NAR模型在并行数据与合成单语翻译的组合数据上进行训练。
实验结果
研究问题
- RQ1单语数据增强是否能提升非自回归NMT模型的性能?
- RQ2使用单语数据是否能减少过拟合并改善泛化能力,特别是在长句上?
- RQ3单语数据对NAR与AR模型之间性能差距的影响如何?
- RQ4单语数据的优势是否与其他NAR技术(如长度并行解码)正交?
- RQ5单语数据带来的收益是否在不同语言对和句子长度上保持一致?
主要发现
- 在WMT16 Ro→En翻译任务中,NAR模型达到33.57 BLEU,创下非迭代NAR方法的新SOTA记录。
- 在WMT14 En→De任务中,模型达到25.73 BLEU,同样是非迭代NAR方法中的最先进水平。
- 在Ro→En方向,NAR模型与AR教师模型之间的性能差距缩小至仅0.11 BLEU点。
- 在所有设置中,添加单语数据均持续提升了BLEU分数,当使用100%的单语数据时,提升最高达+1.40 BLEU点。
- 使用单语数据训练的模型表现出显著减少的过拟合,表现为训练损失与评估损失之间的差距缩小。
- 泛化能力在长句上得到改善:与基线相比,使用单语数据训练的NAR模型在超过80个词的句子上性能下降更少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。