[논문 리뷰] Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla
이 논문은 MMLU 벤치마크에서 다중 선택 문제 해결을 위한 70B 파라미터 Chinchilla 언어 모델에 대한 회로 분석 기법의 확장성을 조사한다. 로짓 기여도, 주의 시각화, 활성화 패치링을 통해 정답 레이블(A, B, C, 또는 D)을 향해 주의를 기울이는 '정답 문자' 주의 헤드를 특정하고, 성능 손실 없이 이를 저랭크 부분공간으로 압축하며, 쿼리 및 키 부분공간이 일반적인 '열거된 항목 중 N번째' 기능을 인코딩하고 있음을 발견한다. 다만 이 설명은 더 넓은 분포에서는 부분적으로만 타당하다.
\emph{Circuit analysis} is a promising technique for understanding the internal mechanisms of language models. However, existing analyses are done in small models far from the state of the art. To address this, we present a case study of circuit analysis in the 70B Chinchilla model, aiming to test the scalability of circuit analysis. In particular, we study multiple-choice question answering, and investigate Chinchilla's capability to identify the correct answer \emph{label} given knowledge of the correct answer \emph{text}. We find that the existing techniques of logit attribution, attention pattern visualization, and activation patching naturally scale to Chinchilla, allowing us to identify and categorize a small set of `output nodes' (attention heads and MLPs). We further study the `correct letter' category of attention heads aiming to understand the semantics of their features, with mixed results. For normal multiple-choice question answers, we significantly compress the query, key and value subspaces of the head without loss of performance when operating on the answer labels for multiple-choice questions, and we show that the query and key subspaces represent an `Nth item in an enumeration' feature to at least some extent. However, when we attempt to use this explanation to understand the heads' behaviour on a more general distribution including randomized answer labels, we find that it is only a partial explanation, suggesting there is more to learn about the operation of `correct letter' heads on multiple choice question answering.
연구 동기 및 목표
- 기존의 회로 분석 기법—로짓 기여도, 주의 시각화, 활성화 패치링—이 Chinchilla(70B 파라미터)와 같은 대규모 언어 모델에 효과적으로 확장되는지 테스트하는 것.
- 다중 선택 문제에서 정답 레이블을 선택하는 데 기여하는 특정 주의 헤드와 MLP를 식별하고 분류하는 것.
- '정답 문자' 헤드의 기능적 의미가 MMLU 분포를 초월해 일반화되는지, 특히 정답 레이블이 무작위화된 경우에 대해 조사하는 것.
- 차원 수축(SVD)을 사용하여 주의 헤드의 쿼리, 키, 밸류 사영 부분공간에서 해석 가능한 부분공간을 추출하고, 그 의미의 일관성을 검증하는 것.
- 왜곡된 입력에 대해 테스트하여 회로 설명의 강건성과 완전성을 평가하고, 대규모 모델에 적용했을 때 현재 해석 기법의 한계를 밝혀내는 것.
제안 방법
- MMLU에서 정답 레이블 선택에 기여하는 주의 헤드를 특정하기 위해 로짓 기여도와 주의 패tern 시각화를 적용하였다.
- 확인된 헤드의 인과적 기여도를 검증하기 위해 활성화 패치링을 사용하였다.
- 특정 '정답 문자' 헤드의 쿼리, 키, 밸류 사영에서 MMLU 입력의 변동성을 포괄하는 3차원 부분공간을 식별하기 위해 특이값 분해(SVD)를 활용하였다.
- 성능 손실 없이 '정답 문자' 헤드의 쿼리, 키, 밸류 부분공간을 저랭크 표현으로 압축하였다.
- 무작위화된 정답 레이블을 포함한 변형된 프롬프트에서의 행동을 조사하여, 식별된 부분공간의 의미적 해석 가능성 평가를 수행하였다.
- 저랭크로 압축된 헤드의 성능을 원본 헤드와 비교하여 MMLU 기준에서 정확도 손실가 없음을 확인하였다.

실험 결과
연구 질문
- RQ1Chinchilla와 같은 70B 파라미터 언어 모델에 표준 회로 분석 기법(로짓 기여도, 활성화 패치링 등)을 성공적으로 적용할 수 있는가?
- RQ2Chinchilla의 '정답 문자' 주의 헤드가 정답 레이블이 무작위화된 경우를 포함한 다양한 입력 분포에서 일관되고 해석 가능한 행동을 보이는가?
- RQ3'정답 문자' 헤드의 쿼리, 키, 밸류 부분공간에 어떤 기능이 인코딩되어 있으며, 이는 '열거된 항목 중 N번째'와 같은 일반화 가능한 패턴을 반영하는가?
- RQ4식별된 저랭크 부분공간 표현이 MMLU 테스트 세트를 초월한 더 넓은 분포에서 헤드의 행동을 어느 정도 설명하는가?
- RQ5현행 해석 도구는 대규모 모델에 적용되었을 때 얼마나 강건하고 완전한가? 실제 고파라미터 환경에서 어떤 한계가 드러나는가?
주요 결과
- 로짓 기여도, 주의 시각화, 활성화 패치링 기법이 70B 파라미터 Chinchilla 모델에 성공적으로 확장되었으며, 이는 MMLU에서 다중 선택 문제 해결에 기여하는 '정답 문자' 주의 헤드와 MLP를 특정하는 데 기여하였다.
- '정답 문자' 헤드는 MMLU 벤치마크에서 성능 손실 없이 쿼리, 키, 밸류 사영의 저랭크 부분공간으로 압축 가능하여, 이는 구조적 단순성을 시사한다.
- 헤드의 쿼리 및 키 부분공간은 일반적인 '열거된 항목 중 N번째' 기능을 인코딩하고 있어, 이는 정답이 선택지 목록에서 어느 위치에 있는지를 탐지하는 데 기여한다.
- 밸류 부분공간은 주로 정답 토큰의 신원(예: 'A', 'B', 'C', 'D')을 인코딩하여 해당 로짓을 강화하는 데 기여한다.
- 식별된 'N번째 항목' 기능은 무작위화되거나 분포 외의 입력에서 헤드 행동을 부분적으로만 설명하며, 이는 이 메커니즘이 이 설명으로 완전히 포괄되지 않는다는 것을 시사한다.
- 결과는 현재 해석 기법의 대규모 적용에서의 한계를 강조하며, 표준 벤치마크에서 잘 작동하는 것처럼 보일지라도 설명이 노이즈가 많거나 불완전하거나 맥락 의존적인 경우가 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.