[论文解读] INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection
本文提出 INSIDE 框架,通过测量基于嵌入协方差特征值的 EigenScore 来检测大语言模型(LLM)的幻觉现象,利用内部状态实现语义一致性分析,并在推理时应用特征裁剪技术以减少过度自信的生成。该方法通过直接分析密集语义表征,无需依赖事后语言层面的一致性检查,在多个问答(QA)基准测试中实现了最先进性能。
Knowledge hallucination have raised widespread concerns for the security and reliability of deployed LLMs. Previous efforts in detecting hallucinations have been employed at logit-level uncertainty estimation or language-level self-consistency evaluation, where the semantic information is inevitably lost during the token-decoding procedure. Thus, we propose to explore the dense semantic information retained within LLMs' extbf{IN}ternal extbf{S}tates for halluc extbf{I}nation extbf{DE}tection ( extbf{INSIDE}). In particular, a simple yet effective extbf{EigenScore} metric is proposed to better evaluate responses' self-consistency, which exploits the eigenvalues of responses' covariance matrix to measure the semantic consistency/diversity in the dense embedding space. Furthermore, from the perspective of self-consistent hallucination detection, a test time feature clipping approach is explored to truncate extreme activations in the internal states, which reduces overconfident generations and potentially benefits the detection of overconfident hallucinations. Extensive experiments and ablation studies are performed on several popular LLMs and question-answering (QA) benchmarks, showing the effectiveness of our proposal.
研究动机与目标
- 解决基于 logits 层次和语言层次的幻觉检测方法在解码过程中丢失语义信息的局限性。
- 探究大语言模型内部状态中保留的密集语义信息是否可实现更精确的幻觉检测。
- 开发一种通过分析嵌入空间特性来检测不一致和过度自信幻觉的方法。
- 通过识别事实性错误生成,无需依赖外部模型,提升 LLM 在真实应用场景中的可靠性。
提出的方法
- 提出一种通用框架 INSIDE,利用大语言模型内部状态进行幻觉检测,而非依赖解码后的文本或 logits。
- 引入 EigenScore,一种通过计算多个响应嵌入协方差矩阵的特征值来衡量密集嵌入空间中语义一致性的/多样性指标。
- 证明 EigenScore 与嵌入空间中的微分熵相关,可作为不确定性的代理指标。
- 在推理时应用特征裁剪技术,截断内部状态中的极端激活,以减少过度自信的生成。
- 使用自回归解码方式,对每个提示生成多个响应,以计算 EigenScore 并检测不一致性。
- 采用标准 QA 基准(如 CoQA、LLaMA-7B)进行评估,使用 AUROC 和正确性指标,并在不同阈值下进行分析。

实验结果
研究问题
- RQ1大语言模型的内部状态是否能保留足够的语义信息,使其在幻觉检测方面优于事后语言层面的方法?
- RQ2基于嵌入协方差特征值推导出的 EigenScore 指标,如何反映语义一致性并检测幻觉?
- RQ3在推理过程中应用特征裁剪是否能减少一致性方法难以捕捉的过度自信幻觉?
- RQ4该方法在不同大语言模型及超参数(如温度和 top-k)下的鲁棒性如何?
主要发现
- 在 CoQA 和 LLaMA-7B 上,EigenScore 在所有正确性阈值下均优于基线方法(如困惑度、LN-熵、词汇相似度),在 0.9 相似度阈值下达到 80.4 的 AUROC。
- 该方法在多种模型和基准上表现优异,表明其适用范围广泛,不仅限于特定架构。
- 特征裁剪显著提升了对过度自信幻觉的检测能力,通过抑制极端激活,尤其在高温设置下效果明显。
- 敏感性分析显示,性能对温度高度敏感,但对 top-k 敏感度较低,最优性能出现在 0.1–1.0 范围内。
- EigenScore 指标能有效捕捉嵌入空间中的微分熵,验证了其作为一致性度量的理论基础。
- 该框架在无需额外模型或微调的情况下,实现了最先进水平的幻觉检测性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。