[论文解读] Prevent the Language Model from being Overconfident in Neural Machine Translation
本文提出一种新颖方法,通过缓解神经机器翻译(NMT)中内在语言模型(LM)的过度自信,减少幻觉现象。该方法引入NMT与LM之间的差距作为LM过度自信的度量,并提出两种优化目标——MTO与MSO,以最大化该差距,从而在WMT14 En-De、WMT19 Zh-En和WMT14 En-Fr任务上分别实现+1.36、+1.50和+0.63的BLEU提升,人工评估进一步证实了翻译准确性的改善。
The Neural Machine Translation (NMT) model is essentially a joint language model conditioned on both the source sentence and partial translation. Therefore, the NMT model naturally involves the mechanism of the Language Model (LM) that predicts the next token only based on partial translation. Despite its success, NMT still suffers from the hallucination problem, generating fluent but inadequate translations. The main reason is that NMT pays excessive attention to the partial translation while neglecting the source sentence to some extent, namely overconfidence of the LM. Accordingly, we define the Margin between the NMT and the LM, calculated by subtracting the predicted probability of the LM from that of the NMT model for each token. The Margin is negatively correlated to the overconfidence degree of the LM. Based on the property, we propose a Margin-based Token-level Objective (MTO) and a Margin-based Sentencelevel Objective (MSO) to maximize the Margin for preventing the LM from being overconfident. Experiments on WMT14 English-to-German, WMT19 Chinese-to-English, and WMT14 English-to-French translation tasks demonstrate the effectiveness of our approach, with 1.36, 1.50, and 0.63 BLEU improvements, respectively, compared to the Transformer baseline. The human evaluation further verifies that our approaches improve translation adequacy as well as fluency.
研究动机与目标
- 探究NMT中翻译不充分的根源,特别是内在语言模型(LM)在生成流畅但错误输出时的过度自信问题。
- 在NMT解码过程中定义LM过度自信的可度量指标,以实现有针对性的干预。
- 提出直接最大化NMT与LM概率之间差距的优化目标,以减少对部分翻译结果的过度依赖。
- 在不增加额外数据或修改模型架构的前提下,仅通过训练阶段的优化,提升翻译的准确度。
提出的方法
- 将NMT与LM之间的差距定义为:对每个目标词元,NMT模型预测概率与LM预测概率之差。
- 提出基于差距的词元级优化目标(MTO),在训练过程中最大化该差距。
- 在基于差距的句子级优化目标(MSO)中引入动态权重函数,以降低包含大量负差距词元的句子的权重,这些句子被识别为“脏数据”,会损害模型性能。
- 在微调阶段应用MSO目标,基于模型自身对差距质量的评估,迭代式地过滤出有问题的训练样本。
- 该方法应用于Transformer架构,无需架构修改,仅通过损失函数调整实现。
- 方法采用端到端训练,使用标准交叉熵损失,同时将差距优化目标作为辅助训练信号加入。
实验结果
研究问题
- RQ1内在语言模型的过度自信在多大程度上导致了NMT中的翻译不充分?
- RQ2在解码过程中,NMT与LM概率之间的差距能否作为LM过度自信的可靠指标?
- RQ3通过辅助优化目标最大化该差距,是否能在不牺牲流畅性的前提下提升翻译的准确性?
- RQ4基于差距质量的动态数据选择机制,能否提升训练效率与模型泛化能力?
主要发现
- 所提出的基于差距的词元级优化目标(MTO)在WMT14英语到德语翻译任务中,相比Transformer基线模型,实现了+1.36的BLEU提升。
- 基于差距的句子级优化目标(MSO)在WMT19中文到英语翻译任务中实现了+1.50的BLEU提升,优于MTO。
- 在WMT14英语到法语任务中,该方法实现了+0.63的BLEU提升,表明在多种语言对上均具有一致的增益。
- 人工评估确认,使用该方法生成的翻译在准确度上显著更优,同时保持或提升了流畅性。
- MSO中的动态权重函数成功识别并降低了“脏数据”(高负差距内容)的权重,提升了训练稳定性和性能。
- 该方法在不改变模型架构或引入外部数据的前提下,仅通过损失函数优化,即实现了翻译质量的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。