Skip to main content
QUICK REVIEW

[论文解读] On the Origin of Hallucinations in Conversational Models: Is it the Datasets or the Models?

Nouha Dziri, Sivan Milton|arXiv (Cornell University)|Apr 17, 2022
Misinformation and Its Impacts被引用 13
一句话总结

本文研究了知识增强型对话模型中的幻觉现象是否源于训练数据集或模型架构。通过对三个主要基准(Wizard of Wikipedia、CMU-DoG、TopicalChat)及最先进模型开展的大规模人工标注研究,作者发现超过60%的黄金标准回复存在幻觉,且模型生成进一步放大了该问题。研究揭示,数据质量和模型行为均对幻觉现象有贡献,从而对当前基准和训练范式的可靠性提出质疑。

ABSTRACT

Knowledge-grounded conversational models are known to suffer from producing factually invalid statements, a phenomenon commonly called hallucination. In this work, we investigate the underlying causes of this phenomenon: is hallucination due to the training data, or to the models? We conduct a comprehensive human study on both existing knowledge-grounded conversational benchmarks and several state-of-the-art models. Our study reveals that the standard benchmarks consist of >60% hallucinated responses, leading to models that not only hallucinate but even amplify hallucinations. Our findings raise important questions on the quality of existing datasets and models trained using them. We make our annotations publicly available for future research.

研究动机与目标

  • 探究对话型人工智能中的幻觉是否源于训练数据或模型架构。
  • 审核广泛使用的知识增强型对话基准(WoW、CMU-DoG、TopicalChat)的事实忠实度。
  • 评估最先进模型在生成过程中是否会放大幻觉。
  • 利用语言学与话语分析,提供幻觉类型的详细分类体系。
  • 发布标注数据,以支持未来在幻觉检测与缓解方面的研究。

提出的方法

  • 采用BEGIN分类法与VRM(言语回应模式)对黄金标准回复与模型生成回复中的幻觉进行人工标注。
  • 对三个基准中的4,000条回复以及GPT-2、DoHA与CTRL模型生成的1,200条模型回复进行标注。
  • 采用分层的Amazon Mechanical Turk(AMT)任务设计,包含资格测试、预演轮次与每日质量检查,以确保标注可靠性。
  • 使用Fleiss’ Kappa衡量标注者间一致性,确保标注者间高度一致。
  • 将回复分类为五类BEGIN类别:蕴含、幻觉、部分幻觉、通用、不合作。
  • 通过分析语言学言语行为(如披露、教诲、建议等),理解幻觉内容的话语特征。

实验结果

研究问题

  • RQ1对话模型中的幻觉主要由有缺陷的训练数据还是模型架构引起?
  • RQ2现有知识增强型基准中,有多少比例的回复存在事实性幻觉?
  • RQ3最先进对话模型是否会放大训练数据中已存在的幻觉?
  • RQ4不同类型的幻觉在人类与模型生成回复中,其语言与话语模式有何特征?
  • RQ5不同模型架构(如GPT-2、DoHA、CTRL)在幻觉特征上存在哪些差异?

主要发现

  • 在三个主要基准(Wizard of Wikipedia、CMU-DoG、TopicalChat)中,超过60%的回复存在幻觉,其中多数涉及未经支持的主观内容,如观点、感受或个人经历。
  • 最常见的幻觉类型为主观表达(如信念、意图)与未经支持的事实性断言,约30-40%的回复属于这两类。
  • 模型生成回复的幻觉率高于黄金标准回复,表明模型会放大数据中的固有问题。
  • 即使专门设计用于减少幻觉的模型(如DoHA)生成的幻觉回复也显著多于训练数据,表明架构存在局限性。
  • BEGIN分类法显示,25%的回复为部分幻觉,15%为通用或不合作类型,进一步降低对话质量。
  • 标注者间一致性较高(Fleiss’ Kappa > 0.75),验证了标注框架与研究发现的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。