Skip to main content
QUICK REVIEW

[论文解读] Towards Best Practices of Activation Patching in Language Models: Metrics and Methods

Fred Zhang, Neel Nanda|arXiv (Cornell University)|Sep 27, 2023
Topic Modeling被引用 4
一句话总结

本文系统评估了语言模型机制可解释性中激活修补方法的诸多方法选择,揭示了噪声方法(高斯噪声 vs. 对称标记替换)、评估指标(logit 差异 vs. 概率)以及滑动窗口修补策略的关键影响。研究发现,高斯噪声会扰乱模型行为并导致结果不一致,而 logit 差异能更好地捕捉模型中的正向与负向组件,因此推荐采用 STR 和 logit 差异作为实现可靠可解释性的最佳实践。

ABSTRACT

Mechanistic interpretability seeks to understand the internal mechanisms of machine learning models, where localization -- identifying the important model components -- is a key step. Activation patching, also known as causal tracing or interchange intervention, is a standard technique for this task (Vig et al., 2020), but the literature contains many variants with little consensus on the choice of hyperparameters or methodology. In this work, we systematically examine the impact of methodological details in activation patching, including evaluation metrics and corruption methods. In several settings of localization and circuit discovery in language models, we find that varying these hyperparameters could lead to disparate interpretability results. Backed by empirical observations, we give conceptual arguments for why certain metrics or methods may be preferred. Finally, we provide recommendations for the best practices of activation patching going forwards.

研究动机与目标

  • 调查激活修补中的方法选择如何影响语言模型的可解释性结果。
  • 评估不同提示损坏方法(高斯噪声与对称标记替换)对定位与电路发现的影响。
  • 比较 logit 差异与概率作为修补效果评估指标的有效性。
  • 分析滑动窗口修补与单层修补在识别模型组件方面的差异。
  • 基于证据提出激活修补的最佳实践建议。

提出的方法

  • 系统性地改变三个关键超参数:提示损坏方法(高斯噪声 vs. 对称标记替换)、评估指标(logit 差异 vs. 概率)以及修补策略(滑动窗口 vs. 单层)。
  • 在多个任务中执行激活修补:事实回忆、间接宾语识别(IOI)、大于比较、Python 文档字符串补全以及算术运算。
  • 使用干净、损坏及修补后的前向传播来测量因果效应:比较模型在损坏输入上的输出与在干净运行中特定激活被替换后的输入输出。
  • 应用滑动窗口修补同时恢复多个 MLP 层的激活,与逐层修补的结果进行对比。
  • 使用统计阈值(例如,均值的两个标准差)检测显著的正向或负向组件。
  • 在 GPT-J 和 GPT-2 small 模型上进行消融研究,以验证不同架构与任务下的发现。
(a) Activation patching intervenes on latent states
(a) Activation patching intervenes on latent states

实验结果

研究问题

  • RQ1不同的提示损坏方法(高斯噪声与对称标记替换)如何影响激活修补在定位任务中的可靠性?
  • RQ2评估指标的选择(logit 差异 vs. 概率)是否会导致对模型组件重要性的不同解读?
  • RQ3滑动窗口修补与单层修补相比,在识别语言模型中的功能电路方面表现如何?
  • RQ4为何高斯噪声会导致不一致的可解释性结果?它是否从根本上不利于因果追踪?
  • RQ5logit 差异能否检测出损害性能的负向模型组件?概率指标是否无法做到这一点?

主要发现

  • 高斯噪声因使模型偏离分布而引发不一致的定位与电路发现结果,破坏了内部机制。
  • 对称标记替换(STR)能保持模型在分布内的行为,其可解释性结果比高斯噪声更可靠、更一致。
  • logit 差异能检测正向与负向模型组件,包括那些损害性能的组件,而概率指标可能忽略负向组件。
  • 滑动窗口修补产生的定位信号比单独修补各层并求和更显著且更连贯。
  • STR 损坏在多个任务中(包括事实回忆与 IOI 电路发现)均产生更稳定、更具可解释性的激活修补结果。
  • 使用 logit 差异作为指标能更精确地检测关键组件,尤其是在识别对性能产生负面影响的注意力头方面。
(b) Patching attention heads
(b) Patching attention heads

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。