[論文レビュー] SelfIE: Self-Interpretation of Large Language Model Embeddings
SelfIE は、追加の訓練を必要とせずに、大規模言語モデル(LLM)が自身の内部埋め込み表現を自然言語で自己解釈できるようにする。この手法により、ゼロショットで忠実な解釈が可能となり、複雑でオープンワールドな概念を扱える。これにより、監視付き制御(倫理的誘導の上書きで95%の効果を発揮)および強化学習制御(プロンプトインジェクションの成功率が84.66%低下)が可能となり、すべての処理は個々の層に対する勾配更新のみで実現される。
How do large language models (LLMs) obtain their answers? The ability to explain and control an LLM's reasoning process is key for reliability, transparency, and future model developments. We propose SelfIE (Self-Interpretation of Embeddings), a framework that enables LLMs to interpret their own embeddings in natural language by leveraging their ability to respond to inquiries about a given passage. Capable of interpreting open-world concepts in the hidden embeddings, SelfIE reveals LLM internal reasoning in cases such as making ethical decisions, internalizing prompt injection, and recalling harmful knowledge. SelfIE's text descriptions on hidden embeddings also open up new avenues to control LLM reasoning. We propose Supervised Control, which allows editing open-ended concepts while only requiring gradient computation of individual layer. We extend RLHF to hidden embeddings and propose Reinforcement Control that erases harmful knowledge in LLM without supervision targets.
研究の動機と目的
- 大規模言語モデル(LLM)が再訓練を伴わずに、自身の内部隠れ表現を自然言語で解釈できるようにすること。
- 倫理的意思決定やプロンプトインジェクションへの反応を含む、複雑な推論プロセスの忠実でオープンワールドな説明を提供すること。
- 特定の隠れ層表現の編集を通じて、軽量で勾配ベースの LLM 動作制御を可能にすること。
- LLM のデコード能力を活用することで、教師データや複雑なプローブに依存するのを減らすこと。
- 自己解釈が、性能の低下を伴わずに有害知識の編集や倫理的誘導の制御を効果的に可能にすることを実証すること。
提案手法
- SelfIE は、関心のある隠れ埋め込みをプロンプト内のプレースホルダーターゲットとして挿入し、その後、前向きパスで LLM を用いてその埋め込みの自然言語的説明を生成する。
- この手法は、LLM がプロンプトに応じて内容を要約または再現する能力を活用し、内部表現の解釈に再利用する。
- 監視付き制御は、LLM の解釈を望ましい行動と一致させるために、単一の層に対する勾配更新を用い、SelfIE が生成した記述をターゲットとして使用する。
- 強化学習制御は、解釈に有害な内容が含まれるかどうかに基づいてフィードバックを提供する報酬モデル(LLM 自身)を用い、教師なしでの編集を可能にする。
- 制御は個々の層に対する勾配降下法を用いて実施され、フルファインチューニングやデータ収集の必要を最小限に抑える。
- 解釈の質は、TextWorld における世界状態追跡やプロンプトインジェクション耐性といったダウンストリームタスクを用いて評価される。

実験結果
リサーチクエスチョン
- RQ1LLM は追加の訓練を伴わずに、自身の隠れ埋め込みを自然言語で自己解釈できるか?
- RQ2自己解釈は、倫理的意思決定やプロンプトインジェクションへの反応といった複雑な推論プロセスを忠実に明らかにできるか?
- RQ3自己解釈は、勾配ベースの編集を通じて、効果的で軽量な LLM 動作制御を可能にするか?
- RQ4強化学習制御は、教師なしやラベル付きデータなしで有害知識を消去できるか?
- RQ5自己解釈に基づく制御は、特定の行動を変更しつつも、モデルの能力を保持できるか?
主な発見
- SelfIE は、TextWorld における世界状態追跡において、100ショットの監視付きプローブと同等の性能を達成し、ゼロショットでの忠実性を示した。
- 監視付き制御は、SelfIE による解釈に基づく層表現の編集を通じて、倫理的誘導の上書きに 95% の効果を発揮した。
- 強化学習制御は、プロンプトインジェクション攻撃の成功率を 89.06% から 4.4% に低下させ、編集効果率が 84.66% に達した。
- 編集済みモデルは、Counterfact ベンチマークで 95.85% の事実知識を保持しており、負の副作用が最小限であることを示した。
- 小規模 LLM(7B および 13B)は、指示に従う能力に欠けるため、解釈の品質が低かったが、指示準拠が確保された場合、70B モデルと同等の正確性を達成した。
- 1 つの有害なプロンプト(例:モロトフコcktail の作成)に対して編集を施すことで、関連のない他の 388 個の有害クエリに対する応答が消去された。これは、編集の一般化能が顕著であることを示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。