Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Attention Network

Meng-Hao Guo, Cheng-Ze Lu|arXiv (Cornell University)|2022. 02. 20.
Advanced Neural Network Applications인용 수 14
한 줄 요약

이 논문은 2D 이미지 구조를 유지하면서 계산 복잡도를 감소시키고 채널별 적응성을 가능하게 하는 선형 자기주의 메커니즘인 Large Kernel Attention (LKA)을 제안한다. LKA를 기반으로 한 시각주의망(VAN)은 ImageNet, COCO, ADE20K와 같은 벤치마크에서 이미지 분류, 객체 검출, 세그멘테이션 작업에서 기존의 유사 크기의 비전 트랜스포머와 CNN보다 우수한 성능을 기록한다.

ABSTRACT

While originally designed for natural language processing tasks, the self-attention mechanism has recently taken various computer vision areas by storm. However, the 2D nature of images brings three challenges for applying self-attention in computer vision. (1) Treating images as 1D sequences neglects their 2D structures. (2) The quadratic complexity is too expensive for high-resolution images. (3) It only captures spatial adaptability but ignores channel adaptability. In this paper, we propose a novel linear attention named large kernel attention (LKA) to enable self-adaptive and long-range correlations in self-attention while avoiding its shortcomings. Furthermore, we present a neural network based on LKA, namely Visual Attention Network (VAN). While extremely simple, VAN surpasses similar size vision transformers(ViTs) and convolutional neural networks(CNNs) in various tasks, including image classification, object detection, semantic segmentation, panoptic segmentation, pose estimation, etc. For example, VAN-B6 achieves 87.8% accuracy on ImageNet benchmark and set new state-of-the-art performance (58.2 PQ) for panoptic segmentation. Besides, VAN-B2 surpasses Swin-T 4% mIoU (50.1 vs. 46.1) for semantic segmentation on ADE20K benchmark, 2.6% AP (48.8 vs. 46.2) for object detection on COCO dataset. It provides a novel method and a simple yet strong baseline for the community. Code is available at https://github.com/Visual-Attention-Network.

연구 동기 및 목표

  • 자기주의의 한계를 해결하기 위해, 2D 이미지를 1D 시퀀스로 처리하는 것, 제곱형 복잡도, 채널 적응성 부족 등의 문제를 해결하고자 한다.
  • 컨볼루션과 자기주의의 장점을 융합하여 비전 작업에 특화된 더 효율적이고 효과적인 주의 메커니즘을 설계하고자 한다.
  • 다양한 비전 작업에서 최신 기술 수준의 성능을 달성하는 단순하면서도 강력한 비전 기반 구조인 Visual Attention Network(VAN)을 제안하고자 한다.
  • 자기주의가 비전 모델에서 대체 불가능하다는 가정을 도전하고자 하며, 더 나은 대안을 제시하고자 한다.

제안 방법

  • 큰 컨볼루션 커널을 사용하여 장거리 의존성을 모델링하면서도 선형 복잡도를 유지하는 선형 주의 메커니즘인 Large Kernel Attention(LKA)을 제안한다.
  • 입력 특징에 기반해 동적으로 조정되는 주의 가중치를 학습함으로써 공간적 및 채널별 적응성을 명시적으로 모델링한다.
  • 다중 헤드 주의나 위치 임베딩이 필요 없도록, 단순한 피드포워드 신경망 아키텍처에 LKA를 통합하여 Visual Attention Network(VAN)을 구성한다.
  • 깊이 분리형 컨볼루션과 채널별 스케일링을 설계하여 효율성과 파rameter 효율성을 유지한다.
  • 특정 작업을 위해 아키텍처를 수정하지 않고도 표준 최적화 프로토콜을 사용하여 표준 비전 벤치마크에서 VAN을 엔드 투 엔드로 훈련한다.
  • 컨볼루션의 2D 인덕티브 바이어스와 주의의 전역 모델링 능력을 학습 가능한 커널 기반 주의 메커니즘을 통해 융합한다.

실험 결과

연구 질문

  • RQ1선형 주의 메커니즘이 비전 작업에서 장거리 모델링을 수행하면서도 2D 공간 구조를 유지할 수 있는가?
  • RQ2채널별 적응성을 통합한 자기주의 메커니즘이 비전 벤치마크에서 표준 자기주의보다 우수한 성능을 내는가?
  • RQ3기존의 복잡한 아키텍처 없이도 새로운 주의 모듈 기반의 단순한 네트워크가 최신 기술 수준의 비전 트랜스포머와 CNN을 능가할 수 있는가?
  • RQ4제안된 LKA 메커니즘이 고해상도 이미지에 대해 표준 자기주의보다 더 효율적이고 효과적인가?
  • RQ5비트랜스포머 기반 구조가 아닌 기반 구조가 다양한 비전 작업에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • VAN-B6는 ImageNet-1K에서 87.8%의 Top-1 정확도를 기록하여 비전 기반 구조의 새로운 최고 기록을 수립했다.
  • VAN-B2는 ADE20K 세그멘테이션 벤치마크에서 mIoU 50.1%로 Swin-T(46.1%)를 4%포인트 이상 앞서며 성능을 뛰어넘었다.
  • COCO 객체 검출 벤치마크에서 VAN-B2는 48.8%의 AP를 기록하여 Swin-T(46.2%)를 2.6%포인트 이상 앞섰다.
  • 패노픽 세그멘테이션에서 VAN-B6는 COCO 데이터셋에서 58.2 PQ를 기록하며 새로운 최고 기록을 수립했다.
  • 세밀한 분류 CUB-200 데이터셋에서 VAN-B4는 작업 특화 설계 없이도 91.3%의 Top-1 정확도를 달성하여 DeiT와 ViT-B를 능가했다.
  • 자극성 탐지에서 VAN-B2는 DUTS-TE에서 F_max 0.919를 기록하여 MAE(0.028)가 낮은 ResNet과 PVT 기반 구조를 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.