[논문 리뷰] On the Relationship between Self-Attention and Convolutional Layers
요지는: 이 논문은 상대 위치 인코딩을 갖춘 다-head 자기-주목이 임의의 합성곱 계층을 표현할 수 있음을 보이고, 경험적으로 초기 층의 어텐션 헤드가 그리드 형태의 CNN과 유사한 국소 패턴을 학습한다는 것을 보여준다.
Recent trends of incorporating attention mechanisms in vision have led researchers to reconsider the supremacy of convolutional layers as a primary building block. Beyond helping CNNs to handle long-range dependencies, Ramachandran et al. (2019) showed that attention can completely replace convolution and achieve state-of-the-art performance on vision tasks. This raises the question: do learned attention layers operate similarly to convolutional layers? This work provides evidence that attention layers can perform convolution and, indeed, they often learn to do so in practice. Specifically, we prove that a multi-head self-attention layer with sufficient number of heads is at least as expressive as any convolutional layer. Our numerical experiments then show that self-attention layers attend to pixel-grid patterns similarly to CNN layers, corroborating our analysis. Our code is publicly available.
연구 동기 및 목표
- self-attention 계층이 합성곱 계층과 유사하게 이미지를 처리하는지의 질문을 제기한다.
- self-attention이 합성곱 계층을 재현할 수 있는 이론적 조건을 제공한다.
- 주의-전용 네트워크의 초기 층에서 어텐션 헤드가 국소적이고 그리드형 패턴을 학습한다는 것을 경험적으로 검증한다.
제안 방법
- 상대 위치 인코딩이 있는 다-head self-attention 계층이 임의의 합성곱 계층을 표현할 수 있음을 구성적 증명으로 보인다(정리 1).
- 제곱형 또는 학습된 상대 위치 인코딩과 함께 어텐션 헤드가 각 쿼리 픽셀 주위의 그리드형 패턴에 주목하는지 보인다.
- 합성곱을 self-attention으로 재매개변수화하기 위한 충분 조건(Lemma 1 및 2)을 도출한다.
- CIFAR-10에서 6-layer self-attention 모델로 실험하여 어텐션 패턴을 관찰하고 성능을 ResNet-18과 비교한다.
- 기사에서 제시된 내용 시퀀스(콘텐츠 기반 어텐션 포함)를 포함하여 제곱형 및 학습된 상대 위치 인코딩의 지역성 대 글로벌 의존성을 연구한다.
실험 결과
연구 질문
- RQ1상대 위치 인코딩을 갖춘 다-head self-attention이 합성곱 계층의 기능적 동작을 재현할 수 있는가?
- RQ2초기 층에서 이미지 데이터로 학습될 때 어텐션 헤드가 국소적이고 합성곱과 같은 수지 receptive fields를 학습하는가?
- RQ3다른 위치 인코딩 방식(제곱형 대 학습된 상대 인코딩)이 비전 트랜스포머의 지역화 및 콘텐츠 기반 어텐션에 어떤 영향을 미치는가?
- RQ4표준 이미지 분류 작업에서 주의만 사용하는 아키텍처와 전통적인 CNN 간의 실용적 성능 및 계산 비용의 트레이드오프는 무엇인가?
주요 결과
- 충분한 헤드 수와 상대 위치 인코딩을 갖춘 다-head self-attention 계층은 임의의 합성곱 계층(커널 크기 K×K, 최소 Dh, Dout 출력 채널)을 표현할 수 있다.
- 실험적으로 초기 어텐션 층은 쿼리 픽셀 주위의 그리드형, 국소적 패턴에 주목하는 경향이 있어 합성곱의 수지 수상(receptive field)을 닮아 있다.
- 제곱형과 학습된 상대 인코딩 모두 국소화된 어텐션 패턴을 생성하며, 후기 층에서 더 큰 패턴에 주목하고 깊은 층에서 콘텐츠 기반 어텐션을 포함한다.
- CIFAR-10에서 어텐션 모델은 유사한 매개변수 수를 가진 ResNet-18과 비슷한 정확도를 달성하나, 일부 구성은 (콘텐츠 어텐션이 있는 학습된 임베딩 등) 뒤처진다.
- 초기 층의 어텐션 확률은 중첩을 피하고 다양한 국소 패턴으로 입력 공간을 커버하는 경향이 있으며, 심층 층은 더 글로벌하고 콘텐츠 주도적인 어텐션을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.