Skip to main content
QUICK REVIEW

[论文解读] On the Inference Calibration of Neural Machine Translation

Shuo Wang, Zhaopeng Tu|arXiv (Cornell University)|May 3, 2020
Natural Language Processing Techniques参考文献 28被引用 6
一句话总结

本文研究神经机器翻译(NMT)中的推理校准问题,揭示即使经过标签平滑训练的模型,在推理阶段仍因训练-推理差异而出现显著的校准偏差。本文提出渐进式标签平滑方法——对高置信度预测施加更高的平滑惩罚,从而在提升校准度的同时改善翻译性能,尤其在大束搜索下效果显著;同时发现,仅扩大编码器可维持校准度并提升性能。

ABSTRACT

Confidence calibration, which aims to make model predictions equal to the true correctness measures, is important for neural machine translation (NMT) because it is able to offer useful indicators of translation errors in the generated output. While prior studies have shown that NMT models trained with label smoothing are well-calibrated on the ground-truth training data, we find that miscalibration still remains a severe challenge for NMT during inference due to the discrepancy between training and inference. By carefully designing experiments on three language pairs, our work provides in-depth analyses of the correlation between calibration and translation performance as well as linguistic properties of miscalibration and reports a number of interesting findings that might help humans better analyze, understand and improve NMT models. Based on these observations, we further propose a new graduated label smoothing method that can improve both inference calibration and translation performance.

研究动机与目标

  • 探究尽管在训练中采用标签平滑已实现良好校准,NMT模型在推理阶段为何仍存在校准偏差的根本原因。
  • 分析校准误差与翻译错误、语言学属性(频率、位置、对齐度、句法角色、粒度)及模型行为之间的关联。
  • 在不降低翻译性能的前提下,尤其在大规模搜索空间下,改善推理校准度。
  • 提出一种新颖的渐进式标签平滑方法,根据预测置信度动态调整平滑惩罚。

提出的方法

  • 本文使用翻译错误率(TER)自动标注生成词元的正确性,从而实现对推理阶段校准度的评估。
  • 构建可靠性图以可视化不同置信度区间内置信度与准确率之间的差距。
  • 提出渐进式标签平滑方法:置信度 >0.7 时平滑惩罚设为 0.3,置信度在 0.3–0.7 之间时设为 0.1,置信度 <0.3 时设为 0.0。
  • 评估正则化(标签平滑、dropout)与模型规模(更深、更宽、仅编码器扩展)对推理校准度与BLEU分数的影响。
  • 通过不同束搜索大小比较三种语料对(WMT14 En-De、En-Fr、En-Ro)的校准性能。
  • 分析校准偏差词元的语言学属性,包括频率、位置、对齐度、句法角色与词粒度。

实验结果

研究问题

  • RQ1为何NMT模型在训练中采用标签平滑后已实现良好校准,但在推理阶段仍存在显著校准偏差?
  • RQ2翻译错误(过翻译、误译、漏译)与置信度预测过高或过低之间存在何种关联?
  • RQ3哪些语言学与结构属性(如频率、位置、对齐度)最能预测NMT输出中的校准偏差?
  • RQ4渐进式标签平滑能否有效降低推理阶段的校准偏差,同时提升翻译性能?
  • RQ5扩大模型规模如何影响推理校准度?仅扩展编码器是否能缓解校准偏差的负面影响?

主要发现

  • 推理校准误差(ECE)显著高于训练阶段——WMT14 En-De数据集上分别为15.83与1.39,表明训练-推理差异导致了巨大偏差。
  • 置信度过高预测与过翻译及误译错误关联更强,而置信度过低预测则与漏译错误关联更强。
  • 低频词更容易出现置信度低估,且更易导致整体置信度过高,尤其在大规模数据中更为明显。
  • 对齐度 ≥2(对应多个源词)的词元更容易出现低估,而对齐度 <1 的词元则更容易出现高估。
  • 渐进式标签平滑能有效降低推理校准误差并提升BLEU分数,尤其在大束搜索(如束大小=100)下效果显著,仅靠ECE降低带来的增益已属边际改善。
  • 扩大模型规模会损害推理校准度;而仅扩展编码器可在维持校准度的同时提升翻译质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。