Skip to main content
QUICK REVIEW

[논문 리뷰] A Close Look at Spatial Modeling: From Attention to Convolution

Xu Ma, Huan Wang|arXiv (Cornell University)|2022. 12. 23.
Advanced Neural Network Applications인용 수 8
한 줄 요약

이 논문은 자기주의에 의해 추출된 쿼리에 영향을 받지 않는 전역적 맥락을 추상화하고 이를 동적으로 합성 컨volution 레이어에 융합함으로써, 파rameter 수가 적은데도 최고 성능을 달성하는 완전 컨볼루션 뷰전 트랜스포머인 FCViT를 제안한다. FCViT-S12는 ImageNet-1K에서 80.9%의 top-1 정확도를 기록하며, ResT-Lite보다 3.7% 높고 파arameter 수가 줄어든 ConvNeXt를 능가한다.

ABSTRACT

Vision Transformers have shown great promise recently for many vision tasks due to the insightful architecture design and attention mechanism. By revisiting the self-attention responses in Transformers, we empirically observe two interesting issues. First, Vision Transformers present a queryirrelevant behavior at deep layers, where the attention maps exhibit nearly consistent contexts in global scope, regardless of the query patch position (also head-irrelevant). Second, the attention maps are intrinsically sparse, few tokens dominate the attention weights; introducing the knowledge from ConvNets would largely smooth the attention and enhance the performance. Motivated by above observations, we generalize self-attention formulation to abstract a queryirrelevant global context directly and further integrate the global context into convolutions. The resulting model, a Fully Convolutional Vision Transformer (i.e., FCViT), purely consists of convolutional layers and firmly inherits the merits of both attention mechanism and convolutions, including dynamic property, weight sharing, and short- and long-range feature modeling, etc. Experimental results demonstrate the effectiveness of FCViT. With less than 14M parameters, our FCViT-S12 outperforms related work ResT-Lite by 3.7% top1 accuracy on ImageNet-1K. When scaling FCViT to larger models, we still perform better than previous state-of-the-art ConvNeXt with even fewer parameters. FCViT-based models also demonstrate promising transferability to downstream tasks, like object detection, instance segmentation, and semantic segmentation. Codes and models are made available at: https://github.com/ma-xu/FCViT.

연구 동기 및 목표

  • 비전 트랜스포머에서 자기주의의 한계, 특히 깊은 레이어에서 희박하고 쿼리에 영향을 받지 않는 주의 맵의 특성을 조사하기 위해.
  • 장거리 의존성을 포괄하는 전역 맥락을 추출하여 주의 메커니즘의 비효율성과 중복을 해결하기 위해.
  • 이 전역 맥락을 컨볼루션 레이어에 통합하여 국소적 특징 모델링을 향상시키면서도 동적 주의 유사 행동을 유지하기 위해.
  • 가중치 공유, 동적 모델링, 장거리 특징 학습의 강점을 모두 갖춘 순수 컨볼루션 아키텍처를 개발하기 위해.
  • 이미지 분류, 객체 검출, 인스턴스 세그멘테이션, 세그멘테이션 작업에서 뛰어난 성능과 이식 가능성을 입증하기 위해.

제안 방법

  • 저자들은 쿼리 의존적 공식을 완화함으로써 자기주의에서 전역 맥락을 추상화하여, 모든 토큰에 공통으로 사용 가능한 쿼리에 영향을 받지 않는 공유 맥락을 도출한다.
  • 이 전역 맥락은 학습 가능한 게이팅 메커니즘을 통해 국소적 컨볼루션 연산에 동적으로 융합되어 장거리 및 국소적 특징의 적응적 통합을 가능하게 한다.
  • 채널 그룹 간의 다양성을 유지하기 위해 다중 그룹 토큰-전역 유사도를 도입하여 주의 헤드의 붕괴를 방지한다.
  • 아키텍처는 완전히 컨볼루션 기반으로, 디프스와이즈 분리형 컨볼루션과 주의 헤드를 대체하는 전역 맥락 주입 모듈을 사용한다.
  • 표준 ImageNet-1K 분류 전훈련을 수행한 후, 표준 객체 검출 및 세그멘테이션 프레임워크를 사용하여 후속 작업에서 미세조정을 수행한다.
  • 경쟁적 정보 블록체인을 적용하여 전역 맥락 학습 중에 중복된 특징을 걸러내어 표현 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1왜 깊은 비전 트랜스포머 레이어에서 자기주의 맵이 쿼리에 영향을 받지 않으며 희박한 행동을 보이며, 의도한 동적이고 쿼리 중심의 주의 기능을 약화시키는가?
  • RQ2자기주의에서 추출된 전역 맥락이 효과적으로 추상화되고 재사용되어 국소적 컨볼루션 특징 학습을 향상시킬 수 있는가?
  • RQ3주의 헤드를 컨볼루션 레이어로 대체함에도 불구하고 주의의 동적 장거리 모델링 기능을 어떻게 유지할 수 있는가?
  • RQ4완전히 컨볼루션 기반 아키텍처가 기존 최고 성능 모델보다 파라미터 수가 적은데도 비전 벤치마크에서 최고 성능을 달성할 수 있는가?
  • RQ5국소 컨볼루션과 전역 맥락의 융합이 객체 검출 및 세그멘테이션과 같은 후속 작업으로의 이식 가능성을 향상시키는가?

주요 결과

  • FCViT-S12는 오직 14M 파라미터로 ImageNet-1K에서 80.9%의 top-1 정확도를 달성하며, ResT-Lite보다 3.7% 높은 성능을 기록한다.
  • 크기가 더 큰 경우에도 FCViT-B24는 ADE20K 세그멘테이션에서 25.3M 파라미터로 45.5%의 mIoU를 기록하며, Twins-PCPVT-S보다 1.2% 높은 성능을 보이며 파라미터 수가 적은데도 우수하다.
  • MS COCO 2017 객체 검출에서 FCViT-Tiny는 파라미터 수가 적음에도 불구하고 PoolFormer-S12보다 5.0 mAP^box와 4.0 mAP^mask 높은 성능을 기록한다.
  • 전역 맥락 추상화가 주의의 희박성과 쿼리에 영향을 받지 않는 현상을 효과적으로 줄이며, ImageNet-1K에서의 시각화 및 통계 분석을 통해 이를 확인했다.
  • FCViT는 뛀난 이식 가능성을 보이며, 인스턴스 세그멘테이션 및 세그멘테이션 작업 모두에서 기존 방법보다 일관된 성능 향상을 기록하며 최고 성능을 달성한다.
  • 다중 그룹 유사도 메커니즘은 주의 헤드 붕괴를 방지하고 특징 표현의 다양성을 유지하여 모델 용량을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.