[논문 리뷰] FIND: A Function Description Benchmark for Evaluating Interpretability Methods
이 논문은 블랙박스 함수의 자연어 또는 코드 기반 설명을 생성하는 자동 해석 방법을 평가하기 위한 FIND라는 벤치마크를 소개한다. 실제 세계의 복잡성인 노이즈와 편향을 가진 절차적으로 생성된 함수를 사용하여 대규모 언어 모델(Large Language Models, LLMs)과 가설 기반 실험을 수행하는 새로운 자동 해석 에이전트(AIA)를 평가한다. 결과적으로 LLMs는 전반적인 행동을 포착하지만 국소적 세부 사항을 놓친다는 점이 드러나며, 이는 자동 해석 분야에서 향상된 도구의 필요성을 강조한다.
Labeling neural network submodules with human-legible descriptions is useful for many downstream tasks: such descriptions can surface failures, guide interventions, and perhaps even explain important model behaviors. To date, most mechanistic descriptions of trained networks have involved small models, narrowly delimited phenomena, and large amounts of human labor. Labeling all human-interpretable sub-computations in models of increasing size and complexity will almost certainly require tools that can generate and validate descriptions automatically. Recently, techniques that use learned models in-the-loop for labeling have begun to gain traction, but methods for evaluating their efficacy are limited and ad-hoc. How should we validate and compare open-ended labeling tools? This paper introduces FIND (Function INterpretation and Description), a benchmark suite for evaluating the building blocks of automated interpretability methods. FIND contains functions that resemble components of trained neural networks, and accompanying descriptions of the kind we seek to generate. The functions span textual and numeric domains, and involve a range of real-world complexities. We evaluate methods that use pretrained language models (LMs) to produce descriptions of function behavior in natural language and code. Additionally, we introduce a new interactive method in which an Automated Interpretability Agent (AIA) generates function descriptions. We find that an AIA, built from an LM with black-box access to functions, can infer function structure, acting as a scientist by forming hypotheses, proposing experiments, and updating descriptions in light of new data. However, AIA descriptions tend to capture global function behavior and miss local details. These results suggest that FIND will be useful for evaluating more sophisticated interpretability methods before they are applied to real-world models.
연구 동기 및 목표
- 자기 해석 방법의 표준화된 평가 부족 문제를 해결하기 위해.
- 블랙박스 함수의 행동을 어떻게 추론하고 설명할 수 있는지 평가하기 위한 벤치마크를 구축하기 위해.
- 대규모 언어 모델(LLMs)과 새로운 상호작용형 에이전트(AIA)가 함수의 정확하고 인간이 읽을 수 있는 설명을 얼마나 잘 생성하는지 효과성을 평가하기 위해.
- 현재 LLM 기반 접근법의 한계, 특히 전반적인 이해는 가능하지만 국소적 행동이나 특수 케이스를 놓치는 점을 규명하기 위해.
- 실제로 복잡한 함수에서 성능을 특성화하여 향후 자동 해석 도구 개발을 안내하기 위해.
제안 방법
- FIND는 수치적, 텍스처적, 합성 신경 모듈을 포함해 2,000개 이상의 함수 해석 문제를 포함한 절차적 생성 벤치마크이다.
- 함수들은 실제 모델의 해석 과제에서 발생하는 도전 과제를 시뮬레이션하기 위해 조합, 근사, 편향, 노이즈 등의 실제 세계의 복잡성을 포함하도록 설계되었다.
- 기본 평가에서는 LLMs를 사용해 함수 행동에 대한 자연어 기반 및 코드 기반 설명을 생성하고, 기준 구현과 비교한다.
- 자동 해석 에이전트(AIA)가 도입되었으며, 이는 LLM을 사용해 가설 수립, 입력 선택, 출력 관찰, 설명 개선을 반복적으로 수행함으로써 과학적 방법을 모방한다.
- 평가에서는 문자열 함수에 대해 문자 일치도를, 코드에 대해 구조 유사도를 사용하며, 함수의 하위군별 성공 점수를 산정한다.
- AIA 방법은 정적 캡션 기반 평가와 달리 상호작용형 탐색을 가능하게 하여, 에이전트가 데이터를 생성하고 가설을 동적으로 업데이트할 수 있다.
실험 결과
연구 질문
- RQ1LLM 기반 방법은 노이즈와 편향과 같은 실제 세계의 복잡성을 지닌 복잡한 블랙박스 함수의 행동을 정확하게 설명할 수 있는가?
- RQ2가설 테스트와 데이터 기반 개선을 사용하는 상호작용형 자동 해석 에이전트(AIA)는 함수의 구조를 얼마나 효과적으로 추론하는가?
- RQ3LLMs는 함수의 전반적 행동을 얼마나 잘 포착하는가? 국소적 또는 경계 케이스 행동은 얼마나 놓치는가?
- RQ4다양한 함수 유형에서 GPT-3.5와 GPT-4 등의 다양한 LLMs는 얼마나 다른 성능을 보이는가?
- RQ5상용 LLMs는 매우 특정하거나 편향된 함수를 해석하는 데 어떤 한계를 보이며, 이를 어떻게 보완할 수 있는가?
주요 결과
- GPT-4와 GPT-3.5는 엔티티 기반 함수 해석에서 유사한 성능을 보이며, 성능이 모델 크기와만 관련이 있음을 시사한다.
- LLM 기반 설명은 일반적으로 함수의 전반적 행동을 포착하지만 국소적 손상이나 특수 케이스(예: 지역별 예외)를 놓친다.
- 반복적 가설 테스트와 데이터 생성을 사용하는 AIA 방법은 정적 캡션 기반 평가보다 더 깊은 함수 행동 탐색을 가능하게 하여 우수한 성능을 보인다.
- 문자열 함수는 복잡하거나 편향된 함수보다 더 신뢰성 있게 해석되며, 성공 점수는 하위군 간에 크게 차이가 난다.
- 벤치마크는 상용 LLMs가 매우 특정된 참조 엔티티(예: 'The New York Times')를 처리하는 데 어려움을 겪는다는 점을 드러내며, 더 나은 예시 초기화 전략이 필요함을 시사한다.
- 복잡한 함수는 원자적 함수보다 일반적으로 더 해석하기 어렵고, 조합성과 편향이 증가할수록 성공률이 크게 떨어진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.