Skip to main content
QUICK REVIEW

[論文レビュー] Towards Best Practices of Activation Patching in Language Models: Metrics and Methods

Fred Zhang, Neel Nanda|arXiv (Cornell University)|Sep 27, 2023
Topic Modeling被引用数 4
ひとこと要約

この論文は、言語モデルの機械的解釈のための活性化パッチ処理における手法的選択について体系的に評価し、汚染手法(ガウスノイズ対対称トークン置換)、評価指標(ロジット差分対確率)、スライディングウィンドウパッチ処理の影響を特定している。ガウスノイズはモデルの挙動を乱し、一貫性のない結果をもたらすのに対し、ロジット差分はポジティブおよびネガティブなモデル構成要素を両方効果的に捉えることができ、信頼性の高い解釈のための最良の実践法としてSTRとロジット差分を推奨する。

ABSTRACT

Mechanistic interpretability seeks to understand the internal mechanisms of machine learning models, where localization -- identifying the important model components -- is a key step. Activation patching, also known as causal tracing or interchange intervention, is a standard technique for this task (Vig et al., 2020), but the literature contains many variants with little consensus on the choice of hyperparameters or methodology. In this work, we systematically examine the impact of methodological details in activation patching, including evaluation metrics and corruption methods. In several settings of localization and circuit discovery in language models, we find that varying these hyperparameters could lead to disparate interpretability results. Backed by empirical observations, we give conceptual arguments for why certain metrics or methods may be preferred. Finally, we provide recommendations for the best practices of activation patching going forwards.

研究の動機と目的

  • 活性化パッチ処理における手法的選択が言語モデルの解釈結果に与える影響を調査すること。
  • ガウスノイズと対称トークン置換の2種類のプロンプト汚染手法が、局所化および回路発見に与える影響を評価すること。
  • パッチ処理効果の評価指標としてのロジット差分と確率の有効性を比較すること。
  • スライディングウィンドウパッチ処理と単一層パッチ処理の違いが、モデル構成要因の同定に与える影響を分析すること。
  • 活性化パッチ処理における最良の実践法について、根拠に基づいた提言を提供すること。

提案手法

  • プロンプト汚染手法(ガウスノイズ対対称トークン置換)、評価指標(ロジット差分対確率)、パッチ処理戦略(スライディングウィンドウ対単一層)という3つの主要ハイパーパrameterを体系的に変化させる。
  • 複数のタスクにおける活性化パッチ処理を実施:事実記憶、間接目的語同定(IOI)、大小比較、Pythonドキュメント文字列の補完、算術計算。
  • クリーン、汚染、パッチ処理済みの順方向プロパゲーションを用いて因果的効果を測定:汚染入力におけるモデル出力と、クリーン実行からの特定の活性化を置き換えた入力における出力を比較する。
  • 複数のMLP層に同時に活性化を回復するスライディングウィンドウパッチ処理を適用し、個別層パッチ処理との結果を比較する。
  • 有意なポジティブまたはネガティブな構成要因を検出するために、統計的閾値(平均からの2標準偏差以内)を用いる。
  • GPT-JおよびGPT-2 smallモデルを用いたアブレーションスタディにより、アーキテクチャおよびタスクをまたいで発見の妥当性を検証する。
(a) Activation patching intervenes on latent states
(a) Activation patching intervenes on latent states

実験結果

リサーチクエスチョン

  • RQ1ガウスノイズと対称トークン置換という異なるプロンプト汚染手法は、局所化タスクにおける活性化パッチ処理の信頼性にどのように影響するか?
  • RQ2評価指標の選択(ロジット差分対確率)によって、モデル構成要因の重要性の解釈が著しく異なることがあるか?
  • RQ3スライディングウィンドウパッチ処理は、単一層パッチ処理と比較して、言語モデルにおける機能的回路の同定にどの程度優れているか?
  • RQ4なぜガウスノイズは一貫性のない解釈結果をもたらすのか?因果的トレースにおいて根本的に問題があるのか?
  • RQ5ロジット差分は性能を悪化させるネガティブなモデル構成要因を検出できるのか?確率はその検出に失敗するのか?

主な発見

  • ガウスノイズはモデルを分布外に追いやり、内部メカニズムを乱すため、局所化および回路発見の結果が一貫性を欠く。
  • 対称トークン置換(STR)は分布内挙動を維持し、ガウスノイズよりも信頼性が高く一貫性のある解釈結果をもたらす。
  • ロジット差分はポジティブおよびネガティブなモデル構成要因を両方検出できるが、確率はネガティブな要因を無視する可能性がある。
  • スライディングウィンドウパッチ処理は、個別層パッチ処理の効果を単純に合算するのと比較して、より顕著で整合性のある局所化信号を生み出す。
  • STRによる汚染は、事実記憶やIOI回路発見を含む複数のタスクにおいて、より安定したかつ解釈可能な活性化パッチ処理の結果をもたらす。
  • ロジット差分を指標として用いることで、性能を悪化させるヘッドをより正確に同定できる。
(b) Patching attention heads
(b) Patching attention heads

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。