[논문 리뷰] Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
이 논문은 언어 모델의 기계적 해석을 위한 활성도 패치 적용에서의 방법론적 선택을 체계적으로 평가하며, 부패 방법(가우시안 노이즈 대 대칭 토큰 대체), 평가 지표(로짓 차이 대 확률), 슬라이딩 윈도우 패치 적용 방식의 중요 영향을 규명한다. 가우시안 노이즈는 모델 동작을 방해하고 일관성 없는 결과를 초래하는 반면, 로짓 차이는 긍정적 및 부정적 모델 구성 요소를 모두 잘 포착하므로, 신뢰할 수 있는 해석을 위해 STR 및 로짓 차이를 최선의 실천 방법으로 권장한다.
Mechanistic interpretability seeks to understand the internal mechanisms of machine learning models, where localization -- identifying the important model components -- is a key step. Activation patching, also known as causal tracing or interchange intervention, is a standard technique for this task (Vig et al., 2020), but the literature contains many variants with little consensus on the choice of hyperparameters or methodology. In this work, we systematically examine the impact of methodological details in activation patching, including evaluation metrics and corruption methods. In several settings of localization and circuit discovery in language models, we find that varying these hyperparameters could lead to disparate interpretability results. Backed by empirical observations, we give conceptual arguments for why certain metrics or methods may be preferred. Finally, we provide recommendations for the best practices of activation patching going forwards.
연구 동기 및 목표
- 활성도 패치 적용에서의 방법론적 선택이 언어 모델의 해석 결과에 어떻게 영향을 미치는지 조사하기.
- 다양한 프롬프트 부패 방법—가우시안 노이즈와 대칭 토큰 대체—가 국소화 및 회로 탐색에 미치는 영향을 평가하기.
- 패치 효과 평가 지표로 로짓 차이와 확률의 효과성을 비교하기.
- 슬라이딩 윈도우 패치 적용과 단일 레이어 패치 적용 간의 차이를 분석하여 모델 구성 요소를 식별하는 데 있어 어떤 영향을 미치는지 분석하기.
- 기반된 증거를 바탕으로 활성도 패치 적용의 최선의 실천 방법을 제안하기.
제안 방법
- 프롬프트 부패 방법(가우시안 노이즈 대비 대칭 토큰 대체), 평가 지표(로짓 차이 대비 확률), 패치 적용 전략(슬라이딩 윈도우 대비 단일 레이어)의 세 가지 핵심 초모수를 체계적으로 변화시킨다.
- 다양한 작업에서 활성도 패치 적용을 수행한다: 사실 기억, 간접 목적어 식별(IOI), 보다 큰 수 비교, 파이썬 문서 문자열 완성, 산수.
- 청결한, 손상된, 패치 적용된 순환 전파를 사용하여 인과 효과를 측정한다: 청결한 실행에서 특정 활성도를 대체한 입력에 대한 모델 출력과 손상된 입력에 대한 출력을 비교한다.
- 슬라이딩 윈도우 패치 적용을 통해 여러 MLP 레이어에 동시에 활성도를 복원하고, 개별 레이어 패치 적용 결과와 비교한다.
- 통계적 임계값(예: 평균에서 두 표준편차 이상 떨어진 값)을 적용하여 긍정적 또는 부정적 구성 요소의 유의미한 변화를 탐지한다.
- GPT-J와 GPT-2 소형 모델을 대상으로 아블레이션 연구를 수행하여 다양한 아키텍처와 작업에서 발견된 결과의 타당성을 검증한다.

실험 결과
연구 질문
- RQ1다양한 프롬프트 부패 방법—가우시안 노이즈와 대칭 토큰 대체—는 국소화 작업에서 활성도 패치 적용의 신뢰성에 어떻게 영향을 미치는가?
- RQ2평가 지표 선택(로짓 차이 대비 확률)이 모델 구성 요소 중요도에 대한 해석을 어떻게 달리 유도하는가?
- RQ3슬라이딩 윈도우 패치 적용은 단일 레이어 패치 적용과 비교해 어떤가? 언어 모델의 기능 회로 식별에 있어 어떤 영향을 미치는가?
- RQ4왜 가우시안 노이즈는 일관성 없는 해석 결과를 초래하며, 원천적으로 인과 추적에 문제가 있는가?
- RQ5로짓 차이는 성능을 해치는 부정적 모델 구성 요소를 감지할 수 있는가? 확률은 그러한 감지를 실패하는가?
주요 결과
- 가우시안 노이즈는 모델을 분포 외부로 몰아넣어 내부 메커니즘을 방해함으로써 국소화 및 회로 탐색 결과의 일관성 없음을 초래한다.
- 대칭 토큰 대체(STR)는 분포 내 행동을 유지하며, 가우시안 노이즈보다 더 신뢰성 있고 일관성 있는 해석 결과를 제공한다.
- 로짓 차이는 긍정적 및 부정적 모델 구성 요소를 모두 감지할 수 있으며, 성능을 해치는 요소까지도 포착하지만, 확률은 이러한 부정적 구성 요소를 간과할 수 있다.
- 슬라이딩 윈도우 패치 적용은 개별 레이어 패치 적용 후 결과를 합산하는 것보다 더 뚜렷하고 일관성 있는 국소화 신호를 생성한다.
- STR 부패는 사실 기억 및 IOI 회로 탐색을 포함한 다양한 작업에서 더 안정적이고 해석 가능한 활성도 패치 적용 결과를 낳는다.
- 로짓 차이를 평가 지표로 사용할 경우, 특히 성능을 해치는 헤드를 식별하는 데 더 정밀한 감지가 가능하다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.