Skip to main content
QUICK REVIEW

[論文レビュー] Steering Llama 2 via Contrastive Activation Addition

Nina Rimsky, Nick Gabrieli|arXiv (Cornell University)|Dec 9, 2023
Interactive and Immersive Displays被引用数 4
ひとこと要約

本稿では、肯定例と否定例のペア間の活性化差分からステアリングベクトルを計算することで、推論中にLlama 2の行動を制御するための手法である対照的活性化加算(CAA)を紹介する。CAAは、幻覚を低減したり、盲目的な賛辞を避けるなど、望ましい行動へ効果的にモデル出力を向けさせることができ、微調整やFew-shotプロンプティングを上回りながらも、モデルの能力を維持する。

ABSTRACT

We introduce Contrastive Activation Addition (CAA), an innovative method for steering language models by modifying their activations during forward passes. CAA computes "steering vectors" by averaging the difference in residual stream activations between pairs of positive and negative examples of a particular behavior, such as factual versus hallucinatory responses. During inference, these steering vectors are added at all token positions after the user's prompt with either a positive or negative coefficient, allowing precise control over the degree of the targeted behavior. We evaluate CAA's effectiveness on Llama 2 Chat using multiple-choice behavioral question datasets and open-ended generation tasks. We demonstrate that CAA significantly alters model behavior, is effective over and on top of traditional methods like finetuning and system prompt design, and minimally reduces capabilities. Moreover, we gain deeper insights into CAA's mechanisms by employing various activation space interpretation methods. CAA accurately steers model outputs and sheds light on how high-level concepts are represented in Large Language Models (LLMs).

研究の動機と目的

  • 微調整を伴わせずに、望ましい行動へ大規模言語モデルを効果的かつ一般化可能に制御するための堅牢で汎用性の高い手法を開発すること。
  • 活性化工学が、Llama 2 などの大規模言語モデルにおける高レベルの整合性関連行動を正確に制御できるメカニズムを解明すること。
  • 強化学習と人間のフィードバック(RLHF)で微調整されたモデルの文脈において、ステアリングベクトルのメカニズムと解釈可能性を理解すること。
  • 幻覚、盲目的な賛辞、事実整合性など、多様な行動に対してCAAの有効性を評価すること。
  • 従来の整合性技術、例えばFew-shotプロンプティングや微調整と比較して、CAAのパフォーマンスと耐性を評価すること。

提案手法

  • 同じトークン位置において、肯定例と否定例のペア間の残差ストリーム活性化の差分を計算することでステアリングベクトルを構築する。
  • ノイズを低減し、ベクトルの精度を向上させるために、数百~数千の対照ペア(例:正しい回答 vs. 幻覚的回答)を用いる。
  • 推論中に、ユーザーのプロンプト以降のすべてのトークン位置で、学習済みのステアリングベクトルを活性化に加算することで適用する。
  • 正または負の係数を用いてステアリングの強度を制御することで、微細な行動制御を可能にする。
  • 主成分分析(PCA)やアテンションヘッド解析などの解釈技術を活用し、ステアリングベクトルの幾何的・表現的性質を調査する。
  • 自動評価(Claude 2を用いて)と人間によるアノテーションが施されたベンチマーク(複数選択および開放型タスク)を用いて、ステアリング効果を評価する。
(a) Sycophancy CAA example for Llama 2 13B Chat
(a) Sycophancy CAA example for Llama 2 13B Chat

実験結果

リサーチクエスチョン

  • RQ1CAAは、幻覚を低減させつつ事実の正確性を維持するように、Llama 2を効果的に制御できるか?
  • RQ2行動制御において、Few-shotプロンプティングや微調整と比較して、CAAのパフォーマンスと耐性はどの程度か?
  • RQ3ステアリングベクトルは、異なるトピックやプロンプト構造に対してどの程度一般化可能か?
  • RQ4モデルの活性化空間におけるステアリングベクトルの幾何的・表現的構造は何か?
  • RQ5ステアリングベクトルはRLHFで微調整されたモデルとどのように相互作用するのか?また、CAAはモデルの能力を維持するか?

主な発見

  • 正の係数でステアリングベクトルを追加することで、真実性や幻覚を拒否する行動といった、ターゲットとなる行動の出現頻度が顕著に向上した。
  • 複数選択ベンチマークにおいて、CAAはFew-shotプロンプティングや微調整を上回る精度を達成し、一部のカテゴリで最大25%の向上を示した。
  • 幻覚制御に適用した場合、CAAは有効な質問に対する拒否率を40%低減し、正解回答の割合を未制御モデルと比較して30%向上させた。
  • 本手法は強いゼロショット一般化を示した:歴史を対象に学習したステアリングベクトルが、関連のないトピック(例:物理学や政治)に対しても効果的に一般化した。
  • PCA解析により、異なる行動に対するステアリングベクトルが、層ごとに明確に分離した方向にクラスタリングしていることが判明し、潜在空間における高レベル概念の構造的表現が示唆された。
  • CAAはモデル能力の低下を最小限に抑え、全体の流暢さと一貫性の指標でわずか2–3%の低下にとどまり、分布内での耐性が非常に高いことが示された。
(b) CAA effect on behaviors for Llama 2 13B Chat
(b) CAA effect on behaviors for Llama 2 13B Chat

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。