Skip to main content
QUICK REVIEW

[论文解读] Contrastive Learning Reduces Hallucination in Conversations

Weiwei Sun, Zhengliang Shi|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用 7
一句话总结

本文提出 MixCL,一种对比学习框架,通过在检索到的知识和模型生成的知识中采用硬负样本的混合对比学习,减少基于大语言模型(LM)的对话系统中的幻觉现象。MixCL 提升了响应的事实性和相关性,在不依赖推理时检索的情况下,性能可与最先进知识库(KB)方法相媲美,且推理速度提升 5 倍,更具可扩展性。

ABSTRACT

Pre-trained language models (LMs) store knowledge in their parameters and can generate informative responses when used in conversational systems. However, LMs suffer from the problem of "hallucination:" they may generate plausible-looking statements that are irrelevant or factually incorrect. To address this problem, we propose a contrastive learning scheme, named MixCL. A novel mixed contrastive objective is proposed to explicitly optimize the implicit knowledge elicitation process of LMs, and thus reduce their hallucination in conversations. We also examine negative sampling strategies of retrieved hard negatives and model-generated negatives. We conduct experiments on Wizard-of-Wikipedia, a public, open-domain knowledge-grounded dialogue benchmark, and assess the effectiveness of MixCL. MixCL effectively reduces the hallucination of LMs in conversations and achieves the highest performance among LM-based dialogue agents in terms of relevancy and factuality. We show that MixCL achieves comparable performance to state-of-the-art KB-based approaches while enjoying notable advantages in terms of efficiency and scalability.

研究动机与目标

  • 为解决基于大语言模型(LM)的对话系统中,模型生成看似合理但事实错误或不相关响应的幻觉问题。
  • 减少开放域、知识增强型对话中的内在幻觉(如虚假事实)和外在幻觉(如离题响应)。
  • 在不依赖外部知识库或推理时检索的前提下,提升 LM 生成响应的忠实度和相关性。
  • 开发一种对比学习框架,显式优化从 LM 参数中提取隐式知识的能力。
  • 在性能上与 KB 方法相当的同时,显著提升推理效率和可扩展性。

提出的方法

  • 提出一种受混合提升数据增强启发的新型混合对比学习目标,在训练过程中混合正样本和负样本知识片段。
  • 引入两种负样本采样方式:(1) 使用密集检索从语料库中检索的硬负样本,(2) 通过自举法生成的模型负样本,以模拟易混淆的知识。
  • 采用基于实体和成分的混合提升策略,在片段级别生成多样化且具有挑战性的负样本。
  • 使用多目标损失函数端到端优化模型,结合混合对比损失、语言模型预训练损失(MLE)和负样本采样目标。
  • 采用双分支架构,将模型生成的响应与真实标签及硬负样本的知识表示进行对比。
  • 通过在训练中内化知识,实现高效推理,消除推理阶段对检索的依赖。

实验结果

研究问题

  • RQ1通过显式对比看似合理但错误的知识,对比学习是否能减少基于 LM 的对话系统中的幻觉?
  • RQ2来自检索和模型生成的硬负样本在多大程度上能提升模型区分正确知识与易混淆知识的能力?
  • RQ3与标准对比学习或 MLE 训练相比,片段级别的混合对比学习是否能增强响应的事实性和相关性?
  • RQ4纯 LM 方法是否能在知识增强型对话中达到 KB 方法的性能水平,同时实现显著更高的效率?
  • RQ5MixCL 在对话特定数据微调过程中,在多大程度上缓解了知识遗忘问题?

主要发现

  • 与基线 BART 相比,MixCL 在 Wizard-of-Wikipedia 数据集上通过专家标注响应评估,将内在幻觉减少 24%,外在幻觉减少 27%。
  • 在自动评估指标(如 KF1 和 F1)中,MixCL 相较于先前的 LM 方法,将响应相关性和事实性提升了 5% 至 15%。
  • 在响应质量方面,MixCL 达到了与最先进 KB 方法(如 KnowledGPT)相当的性能,同时实现 5 倍的推理速度提升。
  • 消融实验证实,混合对比损失目标和硬负样本采样均至关重要,移除后性能最高下降 15%。
  • 人工评估确认,与基线相比,MixCL 生成的响应更具吸引力、事实准确且更接近人类表达。
  • 该模型展现出更优的可扩展性:随着模型规模增大,性能提升幅度明显超过 KB 方法,表明其更好地利用了预训练知识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。