[论文解读] On the Complementarity between Pre-Training and Random-Initialization for Resource-Rich Machine Translation
本文研究了在资源丰富的神经机器翻译中,预训练(PT)与随机初始化(RI)之间的互补性,发现RI在域内准确率方面表现更优,而PT则提升了泛化能力和负向多样性。作者提出一种基于最优传输的模型融合方法,通过对齐并结合PT与RI模型,在WMT17 En-Zh和WMT19 En-De基准上实现了翻译准确率、鲁棒性和多样性的显著提升。
Pre-Training (PT) of text representations has been successfully applied to low-resource Neural Machine Translation (NMT). However, it usually fails to achieve notable gains (sometimes, even worse) on resource-rich NMT on par with its Random-Initialization (RI) counterpart. We take the first step to investigate the complementarity between PT and RI in resource-rich scenarios via two probing analyses, and find that: 1) PT improves NOT the accuracy, but the generalization by achieving flatter loss landscapes than that of RI; 2) PT improves NOT the confidence of lexical choice, but the negative diversity by assigning smoother lexical probability distributions than that of RI. Based on these insights, we propose to combine their complementarities with a model fusion algorithm that utilizes optimal transport to align neurons between PT and RI. Experiments on two resource-rich translation benchmarks, WMT'17 English-Chinese (20M) and WMT'19 English-German (36M), show that PT and RI could be nicely complementary to each other, achieving substantial improvements considering both translation accuracy, generalization, and negative diversity. Probing tools and code are released at: https://github.com/zanchangtong/PTvsRI.
研究动机与目标
- 理解为何在高资源机器翻译设置中,预训练会表现不如随机初始化。
- 探究PT与RI模型在优化景观和词汇概率分布方面的根本差异。
- 协调PT与RI的互补优势,以提升神经机器翻译的整体性能。
- 开发一种融合方法,使单一模型能够同时利用PT的泛化能力与RI的域内准确率。
提出的方法
- 通过二维可视化对损失景观进行探查分析,比较PT与RI模型之间损失曲面的平坦程度。
- 通过测量熵和负向多样性,分析词汇概率分布,评估PT与RI在平滑性上的差异。
- 提出一种基于最优传输的模型融合框架,用于对齐PT与RI模型之间的神经元和权重。
- 基于最优传输距离计算加权组合,融合对齐后的模型,以保留其互补优势。
- 采用两阶段训练流程:首先在单语数据上预训练mBART模型,然后在平行语料上微调以实现PT;RI则使用相同架构从零开始训练。
- 使用SacreBLEU、域外得分、噪声下的鲁棒性(DuA)、多参考BLEU和词类比率(TTR)评估融合性能。
实验结果
研究问题
- RQ1为何在资源丰富的设置中,预训练未能提升域内翻译准确率,反而不如随机初始化?
- RQ2PT与RI模型的优化景观有何不同?这些差异对模型泛化能力有何影响?
- RQ3预训练如何影响词汇概率分布?这与负向多样性及模型鲁棒性有何关联?
- RQ4能否有效结合PT与RI的互补优势,以提升整体神经机器翻译性能?
主要发现
- RI模型在域内翻译准确率方面表现更优(WMT19 En-De上为35.0 BLEU),而PT模型为34.9 BLEU,表明其在目标数据上的优化能力更强。
- PT模型表现出更平坦的损失景观和更平滑的词汇概率分布,有助于提升域外泛化能力和鲁棒性。
- 融合模型在域外(OD)评估中相比RI提升了+0.2 BLEU,表明其泛化能力得到增强。
- 融合模型在DuA(对抗攻击下退化)指标上提升+4.4,表明其对输入噪声的鲁棒性显著优于RI。
- 融合模型在多参考BLEU上提升+0.2 BLEU,在TTR上提升+0.1,证实了翻译多样性的改善。
- 该融合方法通过基于最优传输的对齐,成功结合了PT的优势(泛化能力、平滑性)与RI的优势(域内准确率、置信度)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。