[论文解读] Balancing Training for Multilingual Neural Machine Translation
本文提出 MultiDDS,一种元学习方法,通过优化语言评分器以最大化所有目标语言的平均性能,自动学习多语言神经机器翻译中的最优数据加权。与基于启发式的采样策略不同,MultiDDS 使用可微分且稳定的奖励信号,动态平衡训练数据,在单对多和多对一翻译设置中均持续优于基线方法,性能方差更低,且在不同语言组中更具鲁棒性。
When training multilingual machine translation (MT) models that can translate to/from multiple languages, we are faced with imbalanced training sets: some languages have much more training data than others. Standard practice is to up-sample less resourced languages to increase representation, and the degree of up-sampling has a large effect on the overall performance. In this paper, we propose a method that instead automatically learns how to weight training data through a data scorer that is optimized to maximize performance on all test languages. Experiments on two sets of languages under both one-to-many and many-to-one MT settings show our method not only consistently outperforms heuristic baselines in terms of average performance, but also offers flexible control over the performance of which languages are optimized.
研究动机与目标
- 为解决多语言训练数据不平衡的问题,即高资源语言主导训练过程并损害低资源语言的性能。
- 克服基于启发式数据采样方法的局限性,后者依赖人工调优的温度参数,且忽略语言间的相似性。
- 开发一种与模型无关的可微分方法,自动学习多语言翻译模型的最优数据使用策略。
- 通过可定制的优化目标,灵活控制多语言性能之间的权衡。
- 通过稳定数据加权所用的奖励信号,提升训练稳定性和收敛性。
提出的方法
- 通过将可微分数据选择(DDS)方法扩展至多语言场景,将数据加权建模为元学习问题,以优化语言级别的数据权重。
- 训练一个语言评分器,为每种语言的训练样本分配权重,目标是最小化所有语言在验证集上的平均损失。
- 基于多语言开发集上的平均 BLEU 分数计算奖励信号,实现对所有语言性能的联合优化。
- MultiDDS 提出一种稳定化的奖励变体(MultiDDS-S),降低了优化信号的方差,提升了训练稳定性。
- 该方法采用灵活的评分器参数化方式,在多语言训练中具有内存效率。
- 该方法与模型无关,可应用于任意多语言模型训练设置。
实验结果
研究问题
- RQ1能否自动学习一种数据加权策略,在不依赖启发式采样的情况下提升多语言 NMT 的性能?
- RQ2与基于温度的采样等启发式方法相比,自动学习的数据权重性能如何?
- RQ3该方法能否稳定训练过程并降低不同语言间性能的方差?
- RQ4该方法在多大程度上可灵活调优,以优先提升特定语言的性能?
- RQ5该方法在不同语言组(包括高相似性和低相似性语言组)中是否具备泛化能力?
主要发现
- 在单对多和多对一翻译设置中,MultiDDS 在所有语言的平均 BLEU 分数上均优于启发式基线方法。
- 在多样化语言组中,MultiDDS 在 M2O 设置下达到平均 BLEU 分数 26.94,在 O2M 设置下达到 18.24,方差分别低至 0.02(对比标准 MultiDDS 的 0.04 和 0.05)。
- 稳定化变体 MultiDDS-S 在整个训练过程中表现出更低的奖励方差和更稳定的语言使用模式,优于标准 MultiDDS。
- MultiDDS-S 中学习到的语言分布随时间波动更小,表明训练稳定性得到提升。
- 该方法在相关语言组和多样化语言组中均表现出一致的性能提升,显示出对语言多样性的鲁棒性。
- 该框架支持灵活的优化目标,用户可无需重新训练即可优先优化特定语言的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。