[论文解读] Greedy Search with Probabilistic N-gram Matching for Neural Machine Translation
本文提出一种基于概率n-gram匹配(特别是GLEU)的可微分、序列级训练目标,用于神经机器翻译,无需强化学习即可实现直接梯度更新。通过在训练过程中用贪婪搜索替代教师强制,该方法缓解了暴露偏差,在中英翻译任务上相比强基线模型实现了1.5 BLEU的性能提升。
Neural machine translation (NMT) models are usually trained with the word-level loss using the teacher forcing algorithm, which not only evaluates the translation improperly but also suffers from exposure bias. Sequence-level training under the reinforcement framework can mitigate the problems of the word-level loss, but its performance is unstable due to the high variance of the gradient estimation. On these grounds, we present a method with a differentiable sequence-level training objective based on probabilistic n-gram matching which can avoid the reinforcement framework. In addition, this method performs greedy search in the training which uses the predicted words as context just as at inference to alleviate the problem of exposure bias. Experiment results on the NIST Chinese-to-English translation tasks show that our method significantly outperforms the reinforcement-based algorithms and achieves an improvement of 1.5 BLEU points on average over a strong baseline system.
研究动机与目标
- 解决神经机器翻译中词级别交叉熵损失的局限性,其无法灵活评估翻译质量且存在暴露偏差问题。
- 通过引入可微分的序列级目标,克服基于强化学习的序列级训练中不稳定和高方差的问题。
- 通过使用贪婪搜索进行训练,缓解暴露偏差,使模型在训练期间使用自身预测的词作为上下文,从而模拟推理过程。
- 开发一种基于n-gram匹配(如GLEU)的可微分训练目标,使其与标准评估指标具有强相关性。
- 证明将贪婪搜索与可微分序列级损失结合,优于标准交叉熵训练和基于强化学习的方法。
提出的方法
- 引入基于概率n-gram匹配的可微分序列级目标,具体定义GLEU的概率版本(P-GLEU)作为训练损失。
- 在训练过程中用贪婪解码替代教师强制,使模型基于自身预测的词而非真实词作为上下文,从而减少暴露偏差。
- 使用n-gram精确率(如2-gram)的可微分近似,实现无需强化学习的梯度优化。
- 将概率损失应用于微调预训练的NMT模型,避免因使用新目标从随机初始化开始训练带来的不稳定性。
- 将损失定义为模型输出与参考翻译之间可微分的函数,利用生成n-gram与参考n-gram之间的软对齐。
- 在P-GLEU目标上使用标准反向传播进行模型优化,实现无需策略梯度估计的直接梯度更新。
实验结果
研究问题
- RQ1基于n-gram匹配的可微分序列级目标能否有效替代神经机器翻译中的强化学习进行序列级训练?
- RQ2在训练过程中用贪婪搜索替代教师强制是否能显著减少暴露偏差并提升翻译质量?
- RQ3所提出的概率n-gram匹配与标准自动评估指标(如GLEU)的相关性如何?
- RQ4所提出的方法能否在性能上优于词级别交叉熵训练和基于强化学习的序列级训练?
- RQ5性能提升是源于新损失函数还是解码策略的改变(贪婪 vs. 教师强制)?
主要发现
- 所提方法在NIST中英翻译基准上相比强基线系统实现了1.5 BLEU点的性能提升。
- 即使使用相同的概率损失,训练过程中采用贪婪搜索相比教师强制带来了近1 BLEU点的性能提升。
- 概率GLEU(P-GLEU)目标与标准GLEU具有强相关性(r = 0.86),验证了其作为评估指标代理的有效性。
- 该方法优于基于强化学习的序列级训练方法,后者存在高方差和收敛不稳定的缺点。
- 在预训练模型后使用概率损失进行微调可降低训练成本,并避免从零开始训练新目标时的不稳定性。
- 在不同n-gram目标(BLEU、GLEU、2-gram精确率)中,GLEU表现最佳,因此是本方法的首选选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。