[论文解读] Reducing Hallucinations in Neural Machine Translation with Feature Attribution
该论文提出了一种新颖的辅助损失函数,通过利用特征归因来识别并惩罚过度依赖生成目标词元而忽略源输入的模型,从而减少神经机器翻译中的幻觉现象。通过最小化源词元归因的熵,该方法在低质量数据上提升了模型鲁棒性,在无需从头开始训练的情况下,使幻觉样本的BLEU得分提升了13.75点。
Neural conditional language generation models achieve the state-of-the-art in Neural Machine Translation (NMT) but are highly dependent on the quality of parallel training dataset. When trained on low-quality datasets, these models are prone to various error types, including hallucinations, i.e. outputs that are fluent, but unrelated to the source sentences. These errors are particularly dangerous, because on the surface the translation can be perceived as a correct output, especially if the reader does not understand the source language. We present a case study focusing on model understanding and regularisation to reduce hallucinations in NMT. We first use feature attribution methods to study the behaviour of an NMT model that produces hallucinations. We then leverage these methods to propose a novel loss function that substantially helps reduce hallucinations and does not require retraining the model from scratch.
研究动机与目标
- 探究在低质量平行数据上训练的神经机器翻译模型中幻觉现象的根本原因。
- 利用特征归因方法分析模型在幻觉输出上的行为,识别注意力失效的模式。
- 开发一种可微分的、事后应用的损失函数,以减少幻觉现象,且无需从头开始训练模型。
- 评估所提损失在幻觉样本和非幻觉样本上的有效性,确保对高质量翻译无性能下降。
提出的方法
- 通过积分梯度方法计算源词元和目标词元对模型输出的相关性得分,量化其对翻译决策的贡献。
- 将源词元归因得分的熵作为模型对源输入依赖程度的代理指标;高熵表明对齐不良,可能存在幻觉现象。
- 引入一种新颖的辅助损失,对源词元归因中的高熵进行惩罚,促使模型更一致地关注源内容。
- 在微调过程中,将该损失与标准交叉熵损失及标签平滑损失结合,损失权重设为5,以平衡主损失的量级。
- 在MLQE-PE数据集上评估该方法在罗马尼亚语到英语翻译任务上的表现,以回译输出与原始源句之间的BLEU分数为主要指标。
- 使用fairseq库在强基线Transformer-base模型上进行微调,基线模型与所提模型的超参数保持一致。
实验结果
研究问题
- RQ1在低资源或噪声数据条件下,哪些源输入模式会触发神经机器翻译模型的幻觉?
- RQ2特征归因方法能否定量识别神经翻译模型中易产生幻觉的行为?
- RQ3源词元归因得分的熵是否是幻觉发生情况的可靠指标?
- RQ4基于归因熵的可微分、事后损失能否有效减少幻觉现象,且无需从头开始训练?
- RQ5所提方法是否能保持非幻觉样本的翻译质量,确保对整体性能无负面影响?
主要发现
- 所提辅助损失显著减少了幻觉现象,在幻觉子集上实现了13.75 BLEU点的提升(从10.71提升至24.46 BLEU)。
- 该方法在整体测试集上实现了9.35 BLEU点的提升(从28.90提升至38.25 BLEU),展现出广泛的适用性。
- 源词元归因得分的高熵与幻觉输出存在稳定关联,验证了其作为诊断信号的有效性。
- 模型在非幻觉样本上保持了高性能,BLEU得分提升了9.61点(从35.29提升至44.90),表明对正确翻译无性能下降。
- 该方法成功缓解了多种类型的幻觉,包括脱离型、振荡型和混合型,如定性分析所示。
- 即使存在未登录词(OOV)词元,微调后的模型仍能保持源句的核心语义,鲁棒性优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。