[论文解读] Do LLMs Know about Hallucination? An Empirical Investigation of LLM's Hidden States
本文通过分析 LLaMA 模型在生成响应过程中隐藏状态的变化,探究了大型语言模型(LLMs)是否具备对幻觉的内在意识。在受控实验框架下,对比分析了正确答案与幻觉答案的隐藏状态,作者发现 LLMs 在真实响应与虚构响应中表现出不同的隐藏状态动态,从而推导出一种幻觉意识度量指标,并提出一种基于学习到的正确响应方向的激活工程新策略以减轻幻觉。
Large Language Models (LLMs) can make up answers that are not real, and this is known as hallucination. This research aims to see if, how, and to what extent LLMs are aware of hallucination. More specifically, we check whether and how an LLM reacts differently in its hidden states when it answers a question right versus when it hallucinates. To do this, we introduce an experimental framework which allows examining LLM's hidden states in different hallucination situations. Building upon this framework, we conduct a series of experiments with language models in the LLaMA family (Touvron et al., 2023). Our empirical findings suggest that LLMs react differently when processing a genuine response versus a fabricated one. We then apply various model interpretation techniques to help understand and explain the findings better. Moreover, informed by the empirical observations, we show great potential of using the guidance derived from LLM's hidden representation space to mitigate hallucination. We believe this work provides insights into how LLMs produce hallucinated answers and how to make them occur less often.
研究动机与目标
- 通过分析隐藏表征,探究 LLMs 是否具备对幻觉的内在意识。
- 在相同问题条件下,比较模型处理正确答案与幻觉答案时的隐藏状态转移过程。
- 基于隐藏状态差异,开发一种可量化的 LLM 幻觉意识度量方法。
- 探索是否可利用隐藏状态表征中的引导信息来减少 LLM 输出中的幻觉。
- 评估使用学习到的正确响应方向进行激活工程在引导 LLM 生成真实内容方面的有效性。
提出的方法
- 设计双输入实验框架:一个输入为正确答案,另一个为幻觉答案,两者共享相同的问题。
- 从最终的 Transformer 层提取三个关键隐藏状态:s₁(仅问题)、s₂(问题 + 幻觉答案)和 s₃(问题 + 正确答案)。
- 使用主成分分析(PCA)识别隐藏状态空间中的主导方向:d_corr(正确转移方向)和 d_halluc(幻觉转移方向)。
- 通过在每个解码步骤的最终隐藏状态中添加缩放后的 d_corr 向量(α=100)实施激活工程,以引导生成更真实的内容。
- 在 TruthfulQA 和 HaluEval 数据集上,对比添加与不添加 d_corr 偏移的模型输出,以评估缓解效果。
- 使用可解释性技术(如 PCA 和注意力分析)解释隐藏状态差异,并验证意识度量的有效性。

实验结果
研究问题
- RQ1LLMs 在处理正确答案与幻觉答案时,是否表现出不同的隐藏状态动态?
- RQ2隐藏状态表征在多大程度上能反映 LLM 的内在幻觉意识?
- RQ3是否可以识别出朝向正确响应的隐藏状态转移方向,并用于引导模型行为?
- RQ4在隐藏状态中注入正确响应转移方向是否能减少 LLM 生成中的幻觉?
- RQ5幻觉意识水平与模型不确定性及响应可靠性之间是否存在相关性?
主要发现
- LLMs 在处理正确答案与幻觉答案时表现出显著不同的隐藏状态转移,表明其具备对幻觉的内在意识。
- 最终隐藏状态对正确答案的敏感度高于对幻觉答案的敏感度,表明其内部信号与真实性对齐更强。
- 基于隐藏状态差异推导出的幻觉意识度量指标与模型不确定性及响应可靠性呈正相关。
- 通过战略性地将正确响应转移方向(d_corr)注入隐藏状态,可有效减少幻觉,100% 的测试样本均显示出与真实答案更高的对齐度。
- 激活工程方法成功将 33% 的错误响应逆转为正确响应(如示例 #1),并在其他样本中提升了响应的简洁性与完整性。
- 正确与幻觉转移方向之间的效应量差异(e_corr - e_halluc)在中间到上层 Transformer 层最为显著,95% 置信区间显示趋势一致。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。