Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models

Weihang Su, Changyue Wang|arXiv (Cornell University)|Mar 11, 2024
Anomaly Detection Techniques and Applications被引用 4
一句话总结

本文提出 MIND,一种无监督、实时的幻觉检测框架,通过利用大语言模型(LLMs)在推理过程中产生的内部状态(如上下文嵌入、注意力机制、激活值)来检测事实性错误,无需人工标注。MIND 在新推出的 HELM 基准测试中达到最先进性能,展现出高准确率、低延迟,并与现有 LLM 完全兼容。

ABSTRACT

Hallucinations in large language models (LLMs) refer to the phenomenon of LLMs producing responses that are coherent yet factually inaccurate. This issue undermines the effectiveness of LLMs in practical applications, necessitating research into detecting and mitigating hallucinations of LLMs. Previous studies have mainly concentrated on post-processing techniques for hallucination detection, which tend to be computationally intensive and limited in effectiveness due to their separation from the LLM's inference process. To overcome these limitations, we introduce MIND, an unsupervised training framework that leverages the internal states of LLMs for real-time hallucination detection without requiring manual annotations. Additionally, we present HELM, a new benchmark for evaluating hallucination detection across multiple LLMs, featuring diverse LLM outputs and the internal states of LLMs during their inference process. Our experiments demonstrate that MIND outperforms existing state-of-the-art methods in hallucination detection.

研究动机与目标

  • 为解决后处理幻觉检测方法的局限性,这些方法计算成本高且难以与 LLM 推理集成。
  • 开发一种实时、无监督的框架,在 LLM 推理过程中仅利用模型内部状态检测幻觉。
  • 通过引入 HELM(一个包含生成输出和内部激活值的多 LLM 基准),提升幻觉检测的可复现性与基准测试水平。
  • 消除对昂贵人工标注数据的依赖,以训练幻觉检测器。
  • 实现轻量级、兼容性强的幻觉检测集成,适用于任意基于 Transformer 的 LLM。

提出的方法

  • MIND 从维基百科直接提取伪训练数据以训练检测器,无需人工标注,实现无监督学习。
  • 该框架使用轻量级多层感知机(MLP)分类器,基于推理过程中每个 token 的上下文嵌入、自注意力图和隐藏层激活值进行判断。
  • 通过在 LLM 生成响应时实时分析其内部状态,实现幻觉检测,避免后处理延迟。
  • 该方法与任意基于 Transformer 的 LLM 兼容,仅需在生成过程中访问中间模型状态。
  • 框架端到端训练,利用维基百科中的自监督信号,预测每个 token 的幻觉可能性。
  • 引入新基准 HELM,提供六种 LLM 的输出及其完整内部状态(嵌入、注意力、激活值),用于评估。

实验结果

研究问题

  • RQ1是否可以在不依赖后处理或真实标签标注的情况下实现实时幻觉检测?
  • RQ2仅基于 LLM 内部状态的无监督方法在幻觉检测效果上,与有监督或后处理基线相比如何?
  • RQ3不同内部状态(如注意力、隐藏状态)对幻觉检测性能有何影响?
  • RQ4是否可以有效将轻量级、通用型检测器集成到多种 LLM 架构中,而无需微调?
  • RQ5MIND 的性能如何随分类器深度和训练数据规模的变化而变化?

主要发现

  • MIND 在 HELM 基准测试中实现最先进水平的幻觉检测性能,且无需任何人工标注数据。
  • 当分类器为四层时,模型准确率达到峰值 0.7291,且在该深度之后对深度变化不敏感。
  • 在 4,096 个训练数据点后性能趋于平稳,表明超过该阈值后收益递减。
  • 该框架实现低延迟实时检测,显著优于使用大 LLM 的后处理方法。
  • HELM 基准提供了一个全面的评估平台,包含多样化的 LLM 输出和完整的内部状态记录,提升了可复现性与跨模型比较能力。
  • 在维基百科数据上进行的无监督预训练,使模型在无需微调的情况下,对多种 LLM 展现出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。