[论文解读] Learning a Multi-Domain Curriculum for Neural Machine Translation
本文提出了一种用于神经机器翻译的多领域课程学习框架,通过基于实例级别的领域相关性和噪声减少来动态选择和优先处理训练数据。通过学习一种逐渐强调高质量、多领域相关样本的课程,该方法在所有领域(包括域外)均实现了优越性能,且在大规模、噪声较大的数据集上优于单一领域和无课程基线模型。
Most data selection research in machine translation focuses on improving a single domain. We perform data selection for multiple domains at once. This is achieved by carefully introducing instance-level domain-relevance features and automatically constructing a training curriculum to gradually concentrate on multi-domain relevant and noise-reduced data batches. Both the choice of features and the use of curriculum are crucial for balancing and improving all domains, including out-of-domain. In large-scale experiments, the multi-domain curriculum simultaneously reaches or outperforms the individual performance and brings solid gains over no-curriculum training.
研究动机与目标
- 解决训练单一NMT模型以在多个领域同时实现良好泛化的问题。
- 克服多领域NMT训练中的灾难性遗忘和数据不平衡问题。
- 开发一种动态数据选择方法,优先考虑领域相关性和数据质量。
- 在训练过程中不依赖领域标签的情况下,提升模型在域内和域外测试集上的性能。
- 证明基于实例级特征的课程学习优于静态数据混合和损失加权方法。
提出的方法
- 该方法引入实例级特征,用于衡量每个训练样本的领域相关性和数据质量。
- 通过学习基于领域相关性与噪声减少得分加权组合的排序方式,构建多领域课程。
- 使用可微分目标端到端学习课程,以平衡领域覆盖度和数据质量。
- 利用NMT和NLM特征估计实例级相关性和噪声,并采用基于阈值的选择机制形成数据批次。
- 该方法结合动态数据选择与课程学习,使模型能逐步聚焦于高质量、多领域相关的样本。
- 支持基于课程的训练以及在域内数据上的微调,同时在各领域保持性能增益。
实验结果
研究问题
- RQ1能否在不遭受灾难性遗忘的情况下,有效训练单一NMT模型以覆盖多个领域?
- RQ2如何实现动态且实例特定的数据选择,以提升多领域泛化能力?
- RQ3基于领域相关性和噪声减少的课程学习是否优于静态数据混合或损失加权方法?
- RQ4模型能否在提升域内准确率的同时,保持对域外数据的强性能?
- RQ5不同特征表示方式(按领域 vs. 多领域)如何影响课程学习的性能?
主要发现
- 多领域课程方法在各领域上的性能达到或超过为每个领域单独优化的模型,多领域平均BLEU得分为39.2。
- 与无课程训练相比,该方法在噪声数据集上显著提升性能,平均BLEU从36.3提升至39.2。
- 基于学习权重的课程学习优于简单的实例损失加权,尤其在噪声数据上,D15测试集上BLEU提升达3.9分。
- 在最终课程模型上进行域内数据微调可进一步提升性能,平均BLEU达到40.8,超过基线微调模型。
- 使用联合多领域特征(公式8)略优于各领域特征的线性组合,分别取得39.5 BLEU与39.2 BLEU的成绩。
- 课程学习动态增加了对高质量、多领域相关样本的关注,如图4所示的特征得分趋势所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。