Skip to main content
QUICK REVIEW

[论文解读] Understanding and Detecting Hallucinations in Neural Machine Translation via Model Introspection

Weijia Xu, Sweta Agrawal|arXiv (Cornell University)|Jan 18, 2023
Topic Modeling被引用 6
一句话总结

本文提出了一种基于内部模型症状的神经机器翻译(NMT)幻觉检测方法,通过逐层显著性传播(LRP)识别集中且静态的源端标记贡献。该方法在英文-中文和德文-英文测试集上检测自然幻觉的表现优于无模型基线和基于预训练模型的黑盒检测器。

ABSTRACT

Neural sequence generation models are known to "hallucinate", by producing outputs that are unrelated to the source text. These hallucinations are potentially harmful, yet it remains unclear in what conditions they arise and how to mitigate their impact. In this work, we first identify internal model symptoms of hallucinations by analyzing the relative token contributions to the generation in contrastive hallucinated vs. non-hallucinated outputs generated via source perturbations. We then show that these symptoms are reliable indicators of natural hallucinations, by using them to design a lightweight hallucination detector which outperforms both model-free baselines and strong classifiers based on quality estimation or large pre-trained models on manually annotated English-Chinese and German-English translation test beds.

研究动机与目标

  • 解决神经机器翻译(NMT)中幻觉触发因素缺乏系统理解的问题。
  • 识别在推理过程中能指示幻觉的可靠内部模型症状。
  • 开发一种轻量级、可解释的幻觉检测器,适用于自然、非扰动输入。
  • 相比现有无模型和黑盒方法,提升检测准确率和鲁棒性。
  • 发布人工标注的自然幻觉测试集,以支持未来NMT可信度研究。

提出的方法

  • 通过反事实输入扰动生成幻觉和非幻觉翻译对。
  • 应用逐层显著性传播(LRP)计算源序列和目标序列的相对标记贡献。
  • 分析生成过程中源端贡献模式,识别幻觉的一致症状。
  • 基于两个关键症状检测幻觉:(1) 少数源标记集中贡献,(2) 随时间保持静态的贡献分布。
  • 使用这些症状作为特征训练轻量级分类器,以检测自然测试集中的幻觉。
  • 将检测器与无模型基线、质量估计模型以及基于大规模预训练模型的黑盒分类器进行对比评估。

实验结果

研究问题

  • RQ1在NMT中,哪些内部模型行为或症状与幻觉翻译一致相关?
  • RQ2通过对抗性扰动识别出的症状是否能泛化到自然发生翻译中的幻觉检测?
  • RQ3源端贡献模式与注意力或置信度特征在幻觉检测中的表现如何比较?
  • RQ4基于这些症状的轻量级、白盒检测器是否能优于无模型和黑盒检测方法?
  • RQ5在真实世界翻译场景中,该检测器对领域偏移的鲁棒性如何?

主要发现

  • 集中且静态的源端标记贡献模式是强而可靠的幻觉指标,优于相对源-目标贡献度量。
  • 基于LRP的症状检测方法能有效从扰动输入泛化到真实世界测试集中自然发生的幻觉。
  • 所提出的轻量级检测器在准确率和对领域偏移的鲁棒性方面优于基于大规模预训练模型的黑盒分类器。
  • 在人工标注的英文-中文和德文-英文测试集中,该检测器在幻觉检测中优于无模型基线和基于质量估计的分类器。
  • 研究发现,源端贡献模式比注意力模式或模型置信度分数更具预测性。
  • 作者发布了英文-中文和德文-英文翻译中人工标注的自然幻觉测试集,为未来基准测试提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。