Skip to main content
QUICK REVIEW

[논문 리뷰] Global Self-Attention Networks for Image Recognition

Zhuoran Shen, Irwan Bello|arXiv (Cornell University)|2020. 10. 06.
Advanced Neural Network Applications참고 문헌 23인용 수 20
한 줄 요약

이 논문은 전역적이고 장거리 특징 상호작용을 가능하게 하는 계산적으로 효율적인 주의 메커니즘인 글로벌 자체주의(GSA) 모듈을 제안한다. 이 모듈은 콘텐츠와 공간적 위치를 동시에 모델링하여 딥 네트워크 내에서 전역적인 특징 상호작용을 실현한다. 콘텐츠 중심의 전역 주의 분기와 축 방향 위치 주의를 조합함으로써, GSA 네트워크는 파라미터 수와 계산량을 줄이며 ImageNet과 CIFAR-100에서 컨volutional 모델과 기존의 주의 기반 모델을 능가한다.

ABSTRACT

Recently, a series of works in computer vision have shown promising results on various image and video understanding tasks using self-attention. However, due to the quadratic computational and memory complexities of self-attention, these works either apply attention only to low-resolution feature maps in later stages of a deep network or restrict the receptive field of attention in each layer to a small local region. To overcome these limitations, this work introduces a new global self-attention module, referred to as the GSA module, which is efficient enough to serve as the backbone component of a deep network. This module consists of two parallel layers: a content attention layer that attends to pixels based only on their content and a positional attention layer that attends to pixels based on their spatial locations. The output of this module is the sum of the outputs of the two layers. Based on the proposed GSA module, we introduce new standalone global attention-based deep networks that use GSA modules instead of convolutions to model pixel interactions. Due to the global extent of the proposed GSA module, a GSA network has the ability to model long-range pixel interactions throughout the network. Our experimental results show that GSA networks outperform the corresponding convolution-based networks significantly on the CIFAR-100 and ImageNet datasets while using less parameters and computations. The proposed GSA networks also outperform various existing attention-based networks on the ImageNet dataset.

연구 동기 및 목표

  • 공간 차원에 따라 제곱 복잡도를 가지는 표준 자체주의의 비효율성 문제를 해결한다.
  • 이전 방법들이 지역적 영역에만 주의를 집중하거나 오직 콘텐츠 기반 주의만 사용하는 한계를 극복한다.
  • 계산적으로 효율적인 모듈을 설계하여 전역 주의를 딥 네트워크의 핵심 구성 요소로 활용할 수 있도록 한다.
  • 콘텐츠 정보와 공간적 위치 정보를 모두 주의 메커니즘에 통합하여 이미지 구조화된 데이터를 더 잘 모델링한다.
  • 컨volution을 대체할 수 있는 독립형 전역 주의 기반 네트워크(GSA 네트워크)를 개발한다.

제안 방법

  • 콘텐츠 주의와 위치 주의를 조합한 이중 분기 아키텍처인 GSA 모듈을 제안한다.
  • 콘텐츠 주의는 Chen 등(2018)과 Shen 등(2018)과 유사한 선형 복잡도 전역 주의 메커니즘을 사용하여 구현한다.
  • 위치 주의는 축 방향 공식을 통해 열 기반 주의와 행 기반 주의를 순차적으로 적용함으로써 복잡도를 O(N√N)로 감소시킨다.
  • 두 분기의 출력을 요소별 덧셈을 통해 결합하여 최종 특징 표현을 생성한다.
  • ResNet 내의 공간 컨볼루션을 전부 GSA 모듈로 교체하여 GSA 네트워크를 구성한다.
  • 표준 훈련 프로토콜을 사용하여 ImageNet과 CIFAR-100에서 GSA 네트워크를 엔드 투 엔드로 훈련하고 평가한다.

실험 결과

연구 질문

  • RQ1이미지 인식에서 딥 네트워크의 핵심 구성 요소로 사용될 수 있도록, 전역 자체주의 메커니즘을 계산적으로 충분히 효율적으로 만들 수 있는가?
  • RQ2콘텐츠와 공간적 위치를 함께 모델링하는 주의가 오직 콘텐츠 기반 주의보다 성능 향상에 기여하는가?
  • RQ3전역 주의의 통합이 네트워크의 초기 단계와 후기 단계에서 특징 학습에 어떤 영향을 미치는가?
  • RQ4GSA 네트워크가 정확도, 파라미터 효율성, 추론 속도 면에서 표준 컨볼루션 네트워크와 기존의 주의 기반 모델을 모두 능가할 수 있는가?
  • RQ5GSA 모듈에서 콘텐츠 주의와 위치 주의의 상대 기여도는 어느 정도인가?

주요 결과

  • GSA-ResNet-50는 ImageNet에서 78.5%의 top-1 정확도를 달성하여 원본 ResNet-50(76.9%)과 ResNet-101(78.7%)을 능가하며, 더 빠른 속도와 더 적은 파라미터를 사용한다.
  • ResNet-50의 잔차 블록 2~4에 컨볼루션을 GSA 모듈로 교체하면, ResNet-101과 동일한 top-1 정확도를 달성하지만 런타임이 30% 감소한다.
  • 콘텐츠 주의와 위치 주의를 모두 포함한 전체 GSA 모듈은 78.5%의 top-1 정확도를 기록한다. 반면 오직 콘텐츠 주의만 사용할 경우 7.7%의 정확도 하락이 발생하여 위치 모델링의 필요성을 입증한다.
  • 열 기반 위치 주의가 행 기반 위치 주의보다 더 높은 성능을 보이며, ImageNet 분류에서 수직 상호작용이 더 중요하다는 것을 시사한다.
  • CIFAR-100에서 GSA 네트워크는 해당 ResNet 변종 대비 top-1 정확도를 2.5~2.7% 향상시키며, 파라미터와 계산량도 감소시킨다.
  • GSA 모듈은 ImageNet에서 추론 시간을 31.1 ms로 줄였으며, ResNet-50의 22.6 ms보다 더 높은 정확도를 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.