[論文レビュー] Steering Language Models With Activation Engineering
本論文では、最適化やラベル付きデータを一切用いずに、プロンプトペア間の活性化差分からステアリングベクトルを計算することで、推論時における大規模言語モデルの制御を可能にするActivation Addition (ActAdd) を提案する。この手法により、感情、トピック、スタイルなどの高レベルな出力特性を自然言語による指定で制御可能であり、モデル性能を維持したままモデルサイズに比例してスケーラブルに拡張可能である。
Prompt engineering and finetuning aim to maximize language model performance on a given metric (like toxicity reduction). However, these methods do not fully elicit a model's capabilities. To reduce this gap, we introduce activation engineering: the inference-time modification of activations in order to control (or steer) model outputs. Specifically, we introduce the Activation Addition (ActAdd) technique, which contrasts the intermediate activations on prompt pairs (such as "Love" versus "Hate") to compute a steering vector (Subramani et al. 2022). By tactically adding in e.g. the "Love" - "Hate" steering vector during the forward pass, we achieve SOTA on negative-to-positive sentiment shift and detoxification using models including LLaMA-3 and OPT. ActAdd yields inference-time control over high-level output properties (like topic and sentiment) while preserving performance on off-target tasks. ActAdd is lightweight: it does not require any machine optimization and works with a single pair of data points, which enables rapid iteration over steering. ActAdd demonstrates the power of activation engineering.
研究の動機と目的
- 計算コストの高い微調整や強化学習を用いずに、信頼性の高い方法で大規模言語モデル(LLM)を制御する課題に対処すること。
- 推論時におけるユーザーフレンドリーな自然言語による望ましいモデル行動の指定を可能にすること。
- 逆伝播やラベル付きデータを必要とせず、軽量かつスケーラブルなLLMの制御手法を開発すること。
- 感情、トピック、スタイルなどの高レベルな出力特性に対して標的的な制御を可能にしつつ、モデル全体の性能を維持すること。
提案手法
- 「私はあなたを愛している」と「私はあなたを嫌いだ」といった対照的なプロンプトの間に生じる活性化の差分を用いてステアリングベクトルを計算する。
- 推論時において、特定の層での活性化にステアリングベクトルを加算することで、モデルの残差ストリームに適用する。
- ステアリングの強度を制御するため、学習可能な係数でステアリングベクトルをスケーリングする。
- バックプロパゲーション、微調整、ラベル付きデータを一切必要とせず、ステアリングベクトルを生成可能である。
- 微調整済みのLLMを凍結した状態で推論時に適用可能であり、再トレーニングなしにリアルタイム制御が可能である。
- 目的の行動変化を最大化するように、アブレーションやヒューリスティックサーチにより層と係数を選択する。

実験結果
リサーチクエスチョン
- RQ1自然言語プロンプトペア間の活性化差分が、推論時制御に効果的なステアリングベクトルを信頼性高く生成できるか?
- RQ2ActAddは、分布外または標的外のタスクにおいてもモデルの全体的性能を維持するのか?
- RQ3モデルサイズに伴うスケーリング特性は? また、微調整やRLHFと比較して計算コストはどの程度か?
- RQ4ActAddは感情やトピックといった特定の属性に対して単調または非単調な制御を達成できるか?その背後にある理由は何か?
- RQ5GPT-2、Llama-13B、GPT-J-6Bといった異なるモデルに対して本手法は頑健で、多様なプロンプトに一般化可能か?
主な発見
- ActAddは、OpenWebTextおよびConceptNet上でGPT-2を用いて、微調整を一切行わず、計算コストを最小限に抑えつつ感情、トピック、スタイルの制御に成功した。
- 標的外のタスクにおいてもモデル性能が維持されることから、本手法の頑健性と一般化性能が示された。
- GPT-2において、ラベル付きデータやバックプロパゲーションを一切使用せずに、出力特性(例:「嫌い」から「愛している」に)を顕著に制御できた。
- 残差ストリームの次元の一部を変更した際、非単調な挙動が観察されたことから、活性化空間に複雑な特徴表現や軸の整合性(axis-alignment)が存在することが示唆された。
- 本手法はモデルサイズに自然にスケーリング可能であり、勾配ベースの最適化を必要とする他の活性化工学手法と比較してはるかに実装が容易であった。
- Llama-13Bでも類似の成功が再現されたが、一部のプロンプト(例:エッフェル塔の事実)では再現に失敗しており、文脈や特徴の整合性に敏感であることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。