[论文解读] Gradient-guided Loss Masking for Neural Machine Translation
本文提出梯度引导损失掩码(GLMask),一种用于神经机器翻译的动态数据过滤方法,通过利用训练样本与少量干净数据之间的梯度对齐来识别并掩码有害训练样本。通过掩码负梯度对齐的样本(表示更新存在冲突),GLMask 在多个语种对上均提升了翻译性能,并且在分布外测试集上也具有良好的泛化能力。
To mitigate the negative effect of low quality training data on the performance of neural machine translation models, most existing strategies focus on filtering out harmful data before training starts. In this paper, we explore strategies that dynamically optimize data usage during the training process using the model's gradients on a small set of clean data. At each training step, our algorithm calculates the gradient alignment between the training data and the clean data to mask out data with negative alignment. Our method has a natural intuition: good training data should update the model parameters in a similar direction as the clean data. Experiments on three WMT language pairs show that our method brings significant improvement over strong baselines, and the improvements are generalizable across test data from different domains.
研究动机与目标
- 解决低质量训练数据对神经机器翻译(NMT)性能的负面影响。
- 在训练过程中开发一种动态数据选择策略,而非依赖预训练阶段的过滤。
- 通过利用小规模干净数据集的梯度信息,指导大规模噪声数据的训练,从而提升模型泛化能力。
- 在无需领域特定微调的情况下,实现对领域内和分布外测试集的更好性能。
提出的方法
- GLMask 计算每个训练样本的梯度与小规模干净数据集梯度之间的点积,以衡量梯度对齐程度。
- 将梯度对齐为负的样本进行掩码,即在训练过程中不反向传播其损失。
- 该方法在训练期间运行,利用实时梯度信号动态调整数据使用。
- 掩码在句子和词两个层级上应用,其中词级别掩码表现更优。
- 干净数据集仅用于计算参考梯度,除梯度对齐信号外,不直接影响训练过程。
- 该方法受元学习启发,但采用简单高效的梯度对齐机制,而非复杂的重加权策略。
实验结果
研究问题
- RQ1能否利用训练数据与小规模干净数据集之间的梯度对齐来识别并过滤神经机器翻译中的有害训练样本?
- RQ2在训练过程中采用基于梯度的动态数据掩码是否优于静态过滤或微调方法?
- RQ3GLMask 的改进效果是否能泛化到训练过程中未见的分布外测试集?
- RQ4在领域内和分布外性能方面,GLMask 与强基线方法(如在干净数据上微调)相比如何?
- RQ5哪些类型的训练样本和词语最可能被 GLMask 掩码,其掩码模式是否与已知的噪声特征一致?
主要发现
- 在 WMT 测试集上,GLMask 相较于基线 NMT 模型,将 BLEU 分数分别提升了 0.65(en-de)、1.97(en-zh)和 1.36(en-fr)。
- 在 IWSLT 分布外测试集上,GLMask 相较于基线模型,分别提升了 0.43 BLEU(en-de)、0.46(en-zh)和 0.24(en-fr),表现出强大的泛化能力。
- GLMask 在全部三个语种对上均优于强基线微调方法,分别获得 0.68 BLEU(en-de)、0.97 BLEU(en-zh)和 0.33 BLEU(en-fr)的提升。
- 该方法能有效掩码被复制的句子对——这类是常见噪声来源,尤其在 en-zh 和 en-fr 等噪声更大的语种对中效果显著。
- 掩码率较高的词语通常语义信息较少,如标点符号或非字母字符,表明 GLMask 更倾向于保留语义丰富的内容词。
- 词级别掩码在所有实验中均优于句子级别掩码,表明更细粒度的控制能提升数据选择的准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。