[논문 리뷰] Function Vectors in Large Language Models
이 논문은 자동회귀형 트랜스포머 내에서 입력-출력 함수를 코herent하게 표현하는 기능 벡터(FVs)—작고 작업에 특화된 표현 방식—를 소개한다. 이 FVs는 다양한 맥락 간에 이식 가능하며, 인과적 중재 분석을 통해 FVs를 운반하는 어텐션 헤드를 특정화하였고, 이는 제로샷 및 자연어 설정에서도 임의의 맥락에서 작업 실행을 강력하게 유도한다. 또한 FVs는 단어 수준의 의미를 넘어서 복합 함수 합성에 적합한 구성적 벡터 대수를 지원함을 입증한다.
We report the presence of a simple neural mechanism that represents an input-output function as a vector within autoregressive transformer language models (LMs). Using causal mediation analysis on a diverse range of in-context-learning (ICL) tasks, we find that a small number attention heads transport a compact representation of the demonstrated task, which we call a function vector (FV). FVs are robust to changes in context, i.e., they trigger execution of the task on inputs such as zero-shot and natural text settings that do not resemble the ICL contexts from which they are collected. We test FVs across a range of tasks, models, and layers and find strong causal effects across settings in middle layers. We investigate the internal structure of FVs and find while that they often contain information that encodes the output space of the function, this information alone is not sufficient to reconstruct an FV. Finally, we test semantic vector composition in FVs, and find that to some extent they can be summed to create vectors that trigger new complex tasks. Our findings show that compact, causal internal vector representations of function abstractions can be explicitly extracted from LLMs. Our code and data are available at https://functions.baulab.info.
연구 동기 및 목표
- 대규모 언어 모델(LLMs)이 입력-출력 함수의 내부 재사용 가능한 표현을 내재하고 있는지 조사하기 위해.
- 이러한 표현, 즉 기능 벡터(FVs)가 추출되어 다양한 입력 맥락, 특히 제로샷 및 자연어 설정에서 이식 가능한지 판단하기 위해.
- FVs가 출력 어휘를 넘어서 더 많은 정보를 인코딩하는지, 그리고 새로운 함수를 생성하기 위한 구성적 벡터 연산을 지원하는지 검토하기 위해.
- FVs의 강건성과 일반화 능력이 모델 아키텍처, 레이어, 작업 유형 간에 어떻게 유지되는지 평가하기 위해.
제안 방법
- 인용 맥락 학습(ICL) 동안 정보 흐름을 중재하는 어텐션 헤드를 특정하기 위해 인과적 중재 분석을 사용한다. 이는 특정 헤드가 작업 실행에 기여하는 정도를 고립하여 분석한다.
- 식별된 어텐션 헤드의 활성화를 합산하여 기능 벡터를 구성하며, 이는 제시된 작업의 압축된 표현을 형성한다.
- 활성화 패치 기법을 적용하여 FV를 특정 레이어에 새로운 맥락에 삽입하고, 제로샷 작업 성능에 미치는 영향을 측정한다.
- 디코딩 분석을 통해 FVs가 함수의 출력 공간을 얼마나 잘 인코딩하는지 평가하며, 모델의 다음 토큰 예측에서 상위-k 토큰의 확률을 분석한다.
- 벡터 합성 실험을 통해 간단한 작업의 FV들을 합산했을 때, 직접적으로 제시되지 않은 복합 작업을 수행할 수 있는 새로운 FV가 생성되는지 테스트한다.
- 다양한 모델(GPT-J, Llama 2 등)을 대상으로 실험하며, 6B에서 70B 파라미터에 이르기까지 다양한 크기의 모델과 다양한 ICL 작업(예: 번역, 반의어 생성, 감성 분석 등)을 대상으로 한다.
실험 결과
연구 질문
- RQ1대규모 언어 모델이 다양한 맥락 간에 이식 가능한 압축된 내부 표현을 내재하고 있는가?
- RQ2기능 벡터(FVs)가 원래 ICL 예시와 구조적 유사성이 전혀 없는 맥락에서도 제로샷 및 자연어 설정에서 작업 실행을 유도할 수 있는가?
- RQ3FVs가 함수의 출력 공간을 얼마나 잘 인코딩하는가? 이 인코딩은 FV를 재구성하는 데 충분한가?
- RQ4FV들을 벡터 덧셈을 통해 조합하여, 직접적으로 제시되지 않은 복합적인 작업을 수행할 수 있는 새로운 FV를 생성할 수 있는가?
- RQ5FV는 모델 크기와 레이어 간에 강건한가? 그리고 중간 레이어에서 일관되게 제로샷 성능을 향상시키는가?
주요 결과
- 기능 벡터(FVs)는 트랜스포머 모델의 중간 레이어에서 강력하게 식별되며, 제로샷 및 자연어 맥락에서도 작업 실행을 유도할 수 있다. 예를 들어, GPT-J에서 반의어 생성 작업의 정확도가 최대 24.3%에 이르렀다.
- 한 맥락에서 추출된 FV는 원래 ICL 예제와 구조적 유사성이 전혀 없는 맥락에서도 성공적으로 작업 실행을 유도할 수 있다.
- FVs는 종종 함수의 출력 어휘를 인코딩하지만, 이 정보만으로는 FV를 재구성하는 데 부족하며, 추가적인 구조적 또는 의미적 정보가 포함되어 있음을 시사한다.
- FV의 벡터 합성은 복합적인 새로운 FV를 생성할 수 있으며, 이를 통해 직접적으로 제시되지 않은 복합 작업을 수행할 수 있다. 예를 들어, '첫 글자 대문자'와 '반의어' FV를 합산하면 둘 다 수행하는 벡터를 생성할 수 있다.
- FV 성능은 초기에서 중간 레이어에 삽입했을 때 가장 우수하며, 이 패턴은 6B에서 70B 파라미터의 다양한 모델 크기에서 일관되게 관찰된다 (예: Llama 2).
- Llama 2(13B)에서 벡터 조합된 FV는 복합 '첫 글자 대문자' 작업에서 87%의 정확도를 기록하여 개별 FV를 초월하며 구성적 일반화 능력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.