Skip to main content
QUICK REVIEW

[논문 리뷰] Lightweight Vision Transformer with Cross Feature Attention

Youpeng Zhao, Huadong Tang|arXiv (Cornell University)|2022. 07. 15.
Advanced Neural Network Applications인용 수 8
한 줄 요약

이 논문은 특성 차원에서 작동함으로써 복잡도를 이차에서 선형으로 줄이는 경량 self-attention 메커니즘인 Cross Feature Attention (XFA)를 제안한다. 이 방법은 하이브리드 CNN-ViT 모델인 XFormer을 가능하게 하며, ImageNet-1K(78.5% top-1 정확도), COCO 객체 검출(33.2 mAP), Cityscapes 세분화(78.5 mIoU)에서 최신 기술 수준을 달성한다. 파rameter 수와 FLOPs가 적은 편임에도 불구하고 MobileNetV2와 DeiT를 능가한다.

ABSTRACT

Recent advances in vision transformers (ViTs) have achieved great performance in visual recognition tasks. Convolutional neural networks (CNNs) exploit spatial inductive bias to learn visual representations, but these networks are spatially local. ViTs can learn global representations with their self-attention mechanism, but they are usually heavy-weight and unsuitable for mobile devices. In this paper, we propose cross feature attention (XFA) to bring down computation cost for transformers, and combine efficient mobile CNNs to form a novel efficient light-weight CNN-ViT hybrid model, XFormer, which can serve as a general-purpose backbone to learn both global and local representation. Experimental results show that XFormer outperforms numerous CNN and ViT-based models across different tasks and datasets. On ImageNet1K dataset, XFormer achieves top-1 accuracy of 78.5% with 5.5 million parameters, which is 2.2% and 6.3% more accurate than EfficientNet-B0 (CNN-based) and DeiT (ViT-based) for similar number of parameters. Our model also performs well when transferring to object detection and semantic segmentation tasks. On MS COCO dataset, XFormer exceeds MobileNetV2 by 10.5 AP (22.7 -> 33.2 AP) in YOLOv3 framework with only 6.3M parameters and 3.8G FLOPs. On Cityscapes dataset, with only a simple all-MLP decoder, XFormer achieves mIoU of 78.5 and FPS of 15.3, surpassing state-of-the-art lightweight segmentation networks.

연구 동기 및 목표

  • 모바일 및 경량 설정에서 비전 트랜스포머(ViTs)의 높은 계산 비용을 해결하기 위해.
  • 표준 self-attention이 시퀀스 길이에 따라 이차적으로 증가하는 문제를 해결하여 엣지 디바이스에의 배포를 가능하게 하기 위해.
  • CNN의 국소적 인덕티브 바이어스와 효율적인 ViT의 전역 모델링 능력을 결합한 하이브리드 아키텍처를 설계하기 위해.
  • 분류, 검출, 세분화 작업 전반에서 뛰어난 성능을 보이는 일반 목적의 효율적인 백본을 개발하기 위해.

제안 방법

  • 자신의 attention을 계산하는 데 특성 차원을 사용하는 새로운 attention 메커니즘인 Cross Feature Attention(XFA)를 제안하여, 시퀀스 길이에 대해 복잡도를 선형으로 줄인다.
  • Self-attention의 표준 softmax 연산을 학습 가능한 스케일링 파라미터로 대체하여 학습 안정성과 최적화 성능을 향상시킨다.
  • 국소적 및 전역적 특징 학습을 균형 있게 유지하기 위해 효율적인 CNN 블록과 XFA 트랜스포머 블록을 번갈아가며 구성한 계층적 XFormer 아키텍처를 도입한다.
  • 추가 계산을 최소화하면서도 높은 성능을 유지하기 위해 세분화 작업에 대한 단순한 all-MLP 디코더를 사용한다.
  • 일반화 성능 향상을 위해 ImageNet-1K에서의 사전학습 과정에서 지식 정복과 데이터 증강 기법을 활용한다.
  • 검출 및 세분화 작업에서의 이전성과 효율성을 평가하기 위해 YOLOv3와 SegFormer 프레임워크에 모델을 통합한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머에서 전역 모델링 능력을 유지하면서도 복잡도를 선형으로 줄일 수 있는 self-attention 메커니즘을 재설계할 수 있는가?
  • RQ2경량 아키텍처에서 CNN과 ViT를 효과적으로 융합하여 모바일 비전 작업의 성능을 향상시킬 수 있는가?
  • RQ3하이브리드 CNN-ViT 모델이 여러 비전 벤치마크에서 정확도, 파라미터 효율성, FLOPs 측면에서 최신 기술 수준의 CNN과 ViT를 모두 능가할 수 있는가?
  • RQ4제안된 XFormer 백본은 무거운 디코더 없이도 객체 검출 및 세분화와 같은 후속 작업에 잘 일반화되는가?

주요 결과

  • ImageNet-1K에서 XFormer는 단지 550만 개의 파라미터와 17억 FLOPs로 78.5%의 top-1 정확도를 달성하였으며, 유사한 파라미터 예산에서 EfficientNet-B0보다 2.2% 높고 DeiT보다 6.3% 높다.
  • MS COCO에서의 객체 검출 작업에서 XFormer는 YOLOv3의 성능을 33.2 mAP로 향상시켰으며, MobileNetV2 대비 10.5 포인트 향상되었고, 파라미터 수는 56% 줄이고 FLOPs는 22% 줄였다.
  • Cityscapes에서의 세분화 작업에서 XFormer는 단순한 all-MLP 디코더를 사용해 78.5 mIoU를 달성하였으며, MobileViT 기반의 SegFormer보다 2.9 mIoU 높고 최신 기술 수준의 LVT보다 3.6 mIoU 높았다.
  • XFormer는 높은 추론 속도를 유지하여 Cityscapes에서 15.3 FPS를 기록했으며, YOLOS나 MobileViT와 같은 ViT 기반 모델보다 정확도와 속도에서 모두 뛰어나다.
  • 모델는 뛰어난 이전성 성능를 보이며, 최소한의 아키텍처 수정으로도 검출 및 세분화 작업에서 성능을 크게 향상시킨다.
  • Ablation 연구는 XFA의 선형 복잡도와 학습 가능한 스케일링 인자 값이 특히 자원이 제한된 환경에서 효율성과 성능 향상에 기여함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.