Skip to main content
QUICK REVIEW

[논문 리뷰] On the Expressive Power of Self-Attention Matrices

Valerii Likhosherstov, Krzysztof Choromański|arXiv (Cornell University)|2021. 06. 07.
Gene expression and cancer classification참고 문헌 40인용 수 5
한 줄 요약

이 논문은 은닉 차원 $ d $ 가 시퀀스 길이 $ L $ 에 대해 로그적으로 증가할 때, 입력만을 수정함으로써 각 행과 열에 고정된 수의 비영원소를 가진 희소 어텐션 행렬을 고정된 자체어텐션 메커니즘으로 근사할 수 있음을 보여준다. 핵심 결과는 랜덤 프로젝션과 존슨-린든스트라스 추론을 사용한 구조적 증명으로, 높은 정밀도로 입력에 의존하는 희소 패턴을 근사하기 위해 $ d = O(\log L) $ 가 충분함을 보여준다.

ABSTRACT

Transformer networks are able to capture patterns in data coming from many domains (text, images, videos, proteins, etc.) with little or no change to architecture components. We perform a theoretical analysis of the core component responsible for signal propagation between elements, i.e. the self-attention matrix. In practice, this matrix typically exhibits two properties: (1) it is sparse, meaning that each token only attends to a small subset of other tokens; and (2) it changes dynamically depending on the input to the module. With these considerations in mind, we ask the following question: Can a fixed self-attention module approximate arbitrary sparse patterns depending on the input? How small is the hidden size $d$ required for such approximation? We make progress in answering this question and show that the self-attention matrix can provably approximate sparse matrices, where sparsity is in terms of a bounded number of nonzero elements in each row and column. While the parameters of self-attention are fixed, various sparse matrices can be approximated by only modifying the inputs. Our proof is based on the random projection technique and uses the seminal Johnson-Lindenstrauss lemma. Our proof is constructive, enabling us to propose an algorithm for finding adaptive inputs and fixed self-attention parameters in order to approximate a given matrix. In particular, we show that, in order to approximate any sparse matrix up to a given precision defined in terms of preserving matrix element ratios, $d$ grows only logarithmically with the sequence length $L$ (i.e. $d = O(\log L)$).

연구 동기 및 목표

  • Transformer에서 자체어텐션 행렬의 표현 능력을 이해하고, 특히 희소성과 동적 입력 의존성과 같은 실용적 제약 조건을 고려한다.
  • 고정된 자체어텐션 모듈이 임의의 희소 어텐션 패턴을 근사하기 위해 필요한 최소 은닉 차원 $ d $ 를 규명한다.
  • 근사 정밀도와 시퀀스 길이 의존성에 대한 이론적 경계를 설정하며, 입력에 의존하는 희소 패턴에 집중한다.
  • 원하는 희소 어텐션 행렬을 생성하는 입력과 고정된 어텐션 파rameter를 찾는 구조적 알고리즘을 제공한다.

제안 방법

  • 입력 토큰을 더 낮은 차원 공간으로 임bedding하여 어텐션 패턴을 근사할 수 있도록 하는 랜덤 프로젝션 기법을 사용한다.
  • 존슨-린든스트라스 추론을 적용하여 프로젝션 하에서 토큰 표현 간의 쌍별 거리가 유지되도록 하여 어텐션 가중치 비율의 안정성을 확보한다.
  • 원하는 어텐션 패턴에서 유도된 목표 희소 행렬 $ B $ 를 구성하며, 각 행과 열에 고정된 수의 비영원소를 가진다.
  • 어텐션 행렬을 로그 공간으로 변환하여 크기와 희소성을 제어하고, 농도 경계를 가능하게 한다.
  • 모든 관련 토큰 쌍에 대해 유니온 바운드를 적용하여 근사 오차가 임계값 $ \epsilon_2 $ 를 초과할 확률을 제한한다.
  • 성공적인 근사 확률이 $ 1 - \delta $ 를 초과하도록 하는 $ d $ 의 충분조건을 유도하며, 결과적으로 $ d = O(\log L) $ 를 도출한다.

실험 결과

연구 질문

  • RQ1작은 $ d \ll L $ 를 가진 고정된 자체어텐션 모듈이 입력 변화를 통해 임의의 희소 어텐션 행렬을 근사할 수 있는가?
  • RQ2주어진 정밀도 이내에서 임의의 희소 어텐션 행렬을 근사하기 위해 필요한 최소 은닉 차원 $ d $ 는 얼마인가?
  • RQ3입력에 의존하는 희소 패턴을 근사할 때, 필요한 $ d $ 가 시퀀스 길이 $ L $ 과 어떻게 스케일링되는가?
  • RQ4근사 과정을 구조적으로 만들 수 있는가? 즉, 입력과 파rameter 선택을 위한 명시적 알고리즘이 존재하는가?
  • RQ5존슨-린든스트라스 추론은 어텐션 행렬의 안정적이고 저차원 근사에서 원소 간 비율을 유지하는 데 기여하는가?

주요 결과

  • 고정된 자체어텐션 메커니즘은 은닉 차원 $ d $ 가 시퀀스 길이 $ L $ 에 대해 로그적으로 증가할 때, 임의의 희소 어텐션 행렬을 근사할 수 있다.
  • 근사 결과는 사용자 정의 정밀도 $ \epsilon_2 $ 내에서 어텐션 가중치 비율을 유지하며, 높은 확률 $ \geq 1 - \delta $ 으로 성립한다.
  • 필요한 $ d $ 는 $ L $ 에 대해 로그적으로 증가하므로, 선형 또는 다항식 스케일링보다 훨씬 효율적이다.
  • 증명은 구조적이며, 원하는 희소 어텐션 행렬을 생성하는 입력 임베딩과 고정된 어텐션 파rameter를 계산할 수 있는 알고리즘을 제공한다.
  • 낮은 차원의 임베딩 공간에서 안정성과 정확도를 확보하기 위해 랜덤 프로젝션과 존슨-린든스트라스 유형의 농도 경계에 의존한다.
  • 실험적 검증을 통해 $ k=2 $ 이고 $ L $ 가 수백 수준일 때 $ d $ 가 300에서 1000 사이면 충분함을 확인하였으며, 이는 이론적 예측과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.