[논문 리뷰] Steering Llama 2 via Contrastive Activation Addition
이 논문은 추론 중 Llama 2의 행동을 조정하기 위해 양성 및 부정성 예제 쌍 간의 활성화 차이에서 조정 벡터를 계산하는 대trastive Activation Addition (CAA) 방법을 소개한다. CAA는 환각성이나 복종성 감소와 같은 원하는 행동으로 모델 출력을 효과적으로 이끌어내며, 피팅 테이닝과 소수 샘플 프롬프팅을 능가하면서도 모델 능력을 유지한다.
We introduce Contrastive Activation Addition (CAA), an innovative method for steering language models by modifying their activations during forward passes. CAA computes "steering vectors" by averaging the difference in residual stream activations between pairs of positive and negative examples of a particular behavior, such as factual versus hallucinatory responses. During inference, these steering vectors are added at all token positions after the user's prompt with either a positive or negative coefficient, allowing precise control over the degree of the targeted behavior. We evaluate CAA's effectiveness on Llama 2 Chat using multiple-choice behavioral question datasets and open-ended generation tasks. We demonstrate that CAA significantly alters model behavior, is effective over and on top of traditional methods like finetuning and system prompt design, and minimally reduces capabilities. Moreover, we gain deeper insights into CAA's mechanisms by employing various activation space interpretation methods. CAA accurately steers model outputs and sheds light on how high-level concepts are represented in Large Language Models (LLMs).
연구 동기 및 목표
- 피팅 테이닝 없이도 원하는 행동으로 대규모 언어 모델을 안정적이고 일반화 가능한 방법으로 조정하기 위한 방법 개발.
- 활성화 공학이 Llama 2와 같은 LLM에서 고수준 정렬 관련 행동을 정밀하게 조절할 수 있는지 탐구.
- RLHF로 피팅된 모델의 맥락에서 조정 벡터의 메커니즘과 해석 가능성 이해.
- 환각성, 복종성, 사실 일관성과 같은 다양한 행동에 대해 CAA의 효과 평가.
- 소수 샘플 프롬프팅과 피팅 테이닝과 같은 전통적 정렬 기법과의 성능 및 강건성 비교.
제안 방법
- 같은 토큰 위치에서 양성 및 부정성 예제 쌍 간의 잔차 스트림 활성화 차이를 계산하여 조정 벡터를 구성.
- 노이즈 감소 및 벡터 정밀도 향상을 위해 수백에서 수천 개의 대비 쌍(예: 올바른 답변 대비 환각된 답변)을 사용.
- 사용자 프롬프트 이후 모든 토큰 위치의 활성화에 학습된 조정 벡터를 추가하여 추론 중에 적용.
- 양성 또는 음성 계수를 통해 조정 강도를 제어하여 행동 조절의 미세 조절 가능.
- PCA 및 어텐션 헤드 분석과 같은 해석 기법을 활용해 조정 벡터의 기하학적 및 표현적 특성 탐색.
- 자동 평가(예: Claude 2를 통한 평가)와 다중 선택 및 개방형 과제에서의 인간 평가 기반 벤치마크를 통해 조정 효과 평가.

실험 결과
연구 질문
- RQ1CAA는 사실 정확성을 유지하면서 환각성을 줄이기 위해 Llama 2를 효과적으로 조정할 수 있는가?
- RQ2행동 제어에서 CAA는 소수 샘플 프롬프팅과 피팅 테이닝에 비해 성능 및 강건성 면에서 어떻게 비교되는가?
- RQ3조정 벡터는 다양한 주제와 프롬프트 구조에 대해 얼마나 일반화되는가?
- RQ4모델의 활성화 공간에서 조정 벡터의 기하학적 및 표현적 구조는 어떠한가?
- RQ5조정 벡터는 RLHF로 피팅된 모델과 어떻게 상호작용하는가? CAA는 모델 능력을 유지하는가?
주요 결과
- 양성 계수로 조정 벡터를 추가할 경우, 진실성 및 환각을 거부하는 행동과 같은 목표 행동의 빈도가 크게 증가한다.
- 다중 선택 벤치마크에서 CAA는 소수 샘플 프롬프팅과 피팅 테이닝보다 더 높은 정확도를 기록했으며, 일부 카테고리에서 최대 25% 향상된 바 있다.
- 환각성 조정에 적용했을 때, CAA는 정상적인 질문에 대한 거부율을 40% 감소시키고 올바른 응답 비율을 30% 증가시켜 비조정 모델에 비해 향상된 성능을 보였다.
- 이 방법은 강력한 제로샷 일반화를 보였다: 예를 들어 역사 주제에서 학습한 조정 벡터가 물리나 정치와 같은 관련 없는 주제로도 효과적으로 일반화되었다.
- PCA 분석 결과, 다양한 행동에 대한 조정 벡터가 레이어별로 별개의 방향으로 군집되어 있어, 잠재 공간 내 고수준 개념의 체계적인 표현이 이루어져 있음을 시사했다.
- CAA는 모델 능력에 거의 영향을 주지 않았으며, 전체 유창성 및 통일성 메트릭에서 단지 2–3%의 감소만을 보였고, 이는 높은 내분포 강건성을 의미한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.