Skip to main content
QUICK REVIEW

[论文解读] Detecting Hallucinated Content in Conditional Neural Sequence Generation

Chunting Zhou, Graham Neubig|arXiv (Cornell University)|Nov 5, 2020
Topic Modeling参考文献 57被引用 19
一句话总结

本文提出了一项基于标记级别的幻觉检测任务,旨在识别神经序列生成中未得到输入支持的生成内容。该方法利用合成幻觉数据与微调的预训练语言模型,在机器翻译和抽象摘要任务中取得了优异性能,并通过幻觉感知的损失截断和噪声数据过滤,实现了低资源机器翻译的性能提升。

ABSTRACT

Neural sequence models can generate highly fluent sentences, but recent studies have also shown that they are also prone to hallucinate additional content not supported by the input. These variety of fluent but wrong outputs are particularly problematic, as it will not be possible for users to tell they are being presented incorrect content. To detect these errors, we propose a task to predict whether each token in the output sequence is hallucinated (not contained in the input) and collect new manually annotated evaluation sets for this task. We also introduce a method for learning to detect hallucinations using pretrained language models fine tuned on synthetic data that includes automatically inserted hallucinations Experiments on machine translation (MT) and abstractive summarization demonstrate that our proposed approach consistently outperforms strong baselines on all benchmark datasets. We further demonstrate how to use the token-level hallucination labels to define a fine-grained loss over the target sequence in low-resource MT and achieve significant improvements over strong baseline methods. We also apply our method to word-level quality estimation for MT and show its effectiveness in both supervised and unsupervised settings. Codes and data available at https://github.com/violet-zct/fairseq-detect-hallucination.

研究动机与目标

  • 解决神经序列生成中的幻觉内容问题,即模型生成流畅但与输入无关的、事实性错误的输出。
  • 开发一种与任务无关、可运行时应用的幻觉检测方法,无需依赖参考输出。
  • 构建高质量的人工标注数据集,用于机器翻译和抽象摘要中的幻觉检测。
  • 通过使用幻觉标签对错误 token 进行过滤或损失截断,实现低资源场景下的改进训练。
  • 展示幻觉检测在词粒度质量估计和神经机器翻译自训练中的实用性。

提出的方法

  • 提出一项新任务:预测生成序列中每个 token 是否为幻觉(未被输入支持)或忠实。
  • 通过回译等数据增强技术,在参考输出中插入非蕴含片段,生成合成幻觉数据。
  • 在合成幻觉数据上微调预训练语言模型(如 BERT),使其学习识别 token 级幻觉。
  • 在推理阶段应用训练好的检测器,预测幻觉标签,实现实时忠实度评估。
  • 利用 token 级幻觉标签,在低资源机器翻译中定义细粒度的损失截断方案,对幻觉 token 的梯度进行丢弃。
  • 将该方法应用于监督和无监督设置下的词粒度质量估计,证明其在各类设置中的有效性。

实验结果

研究问题

  • RQ1我们能否在不依赖参考输出或人工标注参考的前提下,实现无需参考输出的 token 级幻觉检测?
  • RQ2在零样本或少样本设置下,基于合成幻觉数据训练的模型在检测真实幻觉方面的有效性如何?
  • RQ3token 级幻觉检测能否通过过滤噪声训练数据或改进自训练,提升低资源神经机器翻译性能?
  • RQ4与标准训练相比,幻觉感知的损失截断在减少幻觉和提升 BLEU 分数方面表现如何?
  • RQ5该幻觉检测模型能否在监督和无监督机器翻译设置下,有效应用于词粒度质量估计?

主要发现

  • 该方法在无需任何人工标注训练数据的情况下,在基准数据集上实现了约 0.6 的平均 F1 分数,为该新任务建立了强有力的基线。
  • 在低资源机器翻译中,幻觉感知的损失截断方法优于强基线,在 WMT2019 共享任务的尼泊尔语-英语和僧伽罗语-英语方向上取得了新的 SOTA 结果。
  • 在 Ne-En 和 Si-En 测试集上,该方法分别取得了 7.4 和 8.11 的 BLEU 分数,超过了 WMT19 共享任务中的最佳提交结果。
  • 在 1000 万条噪声训练数据下,该方法保持了合理性能(BLEU 5.18),而基线方法完全失效(BLEU 0.14),展现出对极端噪声的鲁棒性。
  • 该方法在监督和无监督设置下均提升了词粒度质量估计性能,证明其在机器翻译之外的通用性。
  • 在自训练中使用幻觉标签可降低幻觉率并提升模型性能,即使教师模型生成了噪声输出,效果依然显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。