[论文解读] SelfIE: Self-Interpretation of Large Language Model Embeddings
SelfIE 使大型语言模型能够通过提示模型描述其内部表示而无需额外训练,从而以自然语言自我解释其自身的隐藏嵌入。它实现了零样本、忠实的复杂、开放世界概念解释——通过监督控制(95% 的有效性以覆盖伦理引导)和强化控制(提示注入成功率降低 84.66%),全部仅通过单层的梯度更新实现。
How do large language models (LLMs) obtain their answers? The ability to explain and control an LLM's reasoning process is key for reliability, transparency, and future model developments. We propose SelfIE (Self-Interpretation of Embeddings), a framework that enables LLMs to interpret their own embeddings in natural language by leveraging their ability to respond to inquiries about a given passage. Capable of interpreting open-world concepts in the hidden embeddings, SelfIE reveals LLM internal reasoning in cases such as making ethical decisions, internalizing prompt injection, and recalling harmful knowledge. SelfIE's text descriptions on hidden embeddings also open up new avenues to control LLM reasoning. We propose Supervised Control, which allows editing open-ended concepts while only requiring gradient computation of individual layer. We extend RLHF to hidden embeddings and propose Reinforcement Control that erases harmful knowledge in LLM without supervision targets.
研究动机与目标
- 使大型语言模型(LLMs)能够在不重新训练的情况下,以自然语言解释其自身的内部隐藏表示。
- 提供对复杂推理过程(包括伦理决策和提示注入响应)的忠实、开放世界解释。
- 通过编辑特定隐藏层表示,实现轻量级、基于梯度的 LLM 行为控制。
- 通过利用 LLM 自身的解码能力,减少对监督数据或复杂探测器的依赖。
- 证明自解释能力可实现对有害知识和伦理引导的有效编辑,且不会导致性能下降。
提出的方法
- SelfIE 将感兴趣的隐藏嵌入作为占位符标记插入提示中,然后使用 LLM 在前向传播中生成对该嵌入的自然语言描述。
- 该方法依赖于 LLM 在提示下总结或重复内容的内在能力,并将其重新用于解释内部表示。
- 监督控制通过在单一层上进行梯度更新,使模型的解释与期望行为对齐,以 SelfIE 生成的描述作为目标。
- 强化控制使用奖励模型(即 LLM 本身)基于解释是否包含有害内容提供反馈,从而实现在无监督下的编辑。
- 控制通过在单一层上的梯度下降实现,最大限度减少对完整微调或数据收集的需求。
- 通过下游任务(如 TextWorld 中的世界状态追踪和提示注入抵抗性)评估解释质量。

实验结果
研究问题
- RQ1LLM 是否能够在不额外训练的情况下,以自然语言自我解释其自身的隐藏嵌入?
- RQ2自解释是否能够忠实揭示复杂的推理过程,如伦理决策或提示注入响应?
- RQ3自解释是否能够通过基于梯度的编辑实现有效且轻量级的 LLM 行为控制?
- RQ4强化控制是否能够在无监督或无标注数据的情况下擦除有害知识?
- RQ5基于自解释的控制是否在修改特定行为的同时保持模型能力?
主要发现
- SelfIE 在 TextWorld 中追踪世界状态的表现与 100 次提示的监督探测器相当,证明了零样本下的忠实性。
- 监督控制通过基于 SelfIE 解释编辑层表示,实现了 95% 的有效率以覆盖伦理引导。
- 强化控制将提示注入攻击的成功率从 89.06% 降低至 4.4%,实现了 84.66% 的编辑有效性。
- 编辑后的模型在 Counterfact 基准上保留了 95.85% 的事实知识,表明负面副作用极小。
- 较小的 LLM(7B 和 13B)由于指令遵循能力较差,导致解释质量较低,但当指令遵循得到保证时,其准确率与 70B 模型相当。
- 对单一有害提示(如制作莫洛托夫鸡尾酒)的编辑,成功消除了对 388 个其他无关有害查询的响应,表明编辑具有广泛的泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。