Skip to main content
QUICK REVIEW

[논문 리뷰] How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective

Runyu Peng, Renzhi Li|arXiv (Cornell University)|2026. 02. 04.
Artificial Intelligence in Healthcare and Education인용 수 0
한 줄 요약

본 논문은 위치-제로 토큰이 안정적이고 높은 노름 표현을 얻도록 하는 간단한 두-layer P0-Sink Circuit를 식별하고, 이로 인해 LLM에서 attention sinks가 발생하는 현상을 다루며, 사전 학습 중 그 출현을 추적한다.

ABSTRACT

Large Language Models (LLMs) often allocate disproportionate attention to specific tokens, a phenomenon commonly referred to as the attention sink. While such sinks are generally considered detrimental, prior studies have identified a notable exception: the model's consistent emphasis on the first token of the input sequence. This structural bias can influence a wide range of downstream applications and warrants careful consideration. Despite its prevalence, the precise mechanisms underlying the emergence and persistence of attention sinks remain poorly understood. In this work, we trace the formation of attention sinks around the first token of the input. We identify a simple mechanism, referred to as the P0 Sink Circuit, that enables the model to recognize token at position zero and induce an attention sink within two transformer blocks, without relying on any semantic information. This mechanism serves as the basis for the attention sink on position zero. Furthermore, by analyzing training traces from a 30B A3B MoE model trained from scratch, we find that this mechanism emerges early in training and becomes increasingly concentrated in the first two layers, suggesting a possible signal for tracking pre training convergence states.

연구 동기 및 목표

  • 대형 언어 모델에서 위치-제로 attention sink가 왜 나타나는지 조사한다.
  • BOS 토큰이 P0 sink를 이끄는지, 아니면 더 깊은 아키텍처적 메커니즘이 존재하는지 확인한다.
  • P0를 식별하고 그 표현을 증폭하는 간단한 회로를 제안하고 검증한다.
  • 사전 학습 중 및 모델 계층 전반에서 P0-Sink Circuit의 형성 및 안정화를 추적한다.
  • 사전 학습 수렴 및 학습 단계의 지표로 sinks 동역학의 잠재적 활용 가능성을 평가한다.

제안 방법

  • 원인-주의 마스킹 비대칭을 활용하는 두-layer 트랜스포머 메커니즘으로 P0-Sink Circuit을 도입한다.
  • BOS 시맨틱스에 의존하지 않고 위치-제로를 식별하고 높은 노름의 고정 표현으로 증폭시킬 수 있음을 보인다.
  • BOS를 제거한 소거 연구를 사용하여 BOS 시맨틱스에 대한 의존성을 검사한다.
  • cone 기반 값-벡터 구성과 헤드 간 균일 평균화를 이용한 어텐션 출력 노름의 이론적 모델을 제시한다.
  • 30B-A3B MoE 모델의 학습 추적 데이터를 실험적으로 분석하여 P0-Sink Circuit의 계층 간 등장 및 응집을 추적한다.
  • 프리-레이어 정규화와 MLP 증폭이 P0 표현을 어떻게 안정화하는지 검토한다.

실험 결과

연구 질문

  • RQ1LLM에서 위치-제로 attention sink의 출현을 촉진하는 메커니즘은 무엇인가?
  • RQ2P0 sink에 BOS 토큰이 필수적인가, 아니면 BOS 독립 회로가 존재하는가?
  • RQ3사전 학습 중 계층 간 P0-Sink Circuit가 어떻게 형성되고 집중되는가?
  • RQ4P0-Sink를 학습 단계나 수렴의 진단 신호로 사용할 수 있는가?

주요 결과

  • 간단한 P0-Sink Circuit가 존재한다: 인과 마스킹 비대칭을 사용하여 위치 영을 식별하고 고 노름의 고정 방향으로 숨겨진 상태를 증폭하는 두-layer 메커니즘이다.
  • P0 sink는 BOS를 제거해도 지속되며, BOS 의미 체계에만 의존하는 것이 아니다.
  • P0-Sink Circuit은 사전 학습 초기 단계에 나타나고, 처음에는 더 깊은 층에서 시작하여 처음 두 층에 집중되다가 이후에는 초기 레이어 sink로 확산된다.
  • MLP 하위층은 노름 증폭 및 방향성 투영에 기여하여 계층 전체에서 안정적인 P0 표현을 가능하게 한다.
  • 상대적/로터리 위치 인코딩 하에서도 P0 sink는 분포 밖의 교란 및 토큰 반복에 강건하며 BOS 독립 메커니즘을 뒷받침한다.
  • 결과는 sink 단계가 사전 학습 수렴 상태 및 학습 진행 상황의 진단 신호로 활용될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.