[논문 리뷰] CMT: Convolutional Neural Networks Meet Vision Transformers
CMT는 CNN 줄기를 트랜스포머 스타일 블록과 결합하여 이미지넷 및 COCO에서 유사 CNN 및 ViT 모델보다 성능이 뛰어나고 FLOPs가 더 낮은 계층적 다중 스케일 백본을 만듭니다.
Vision transformers have been successfully applied to image recognition tasks due to their ability to capture long-range dependencies within an image. However, there are still gaps in both performance and computational cost between transformers and existing convolutional neural networks (CNNs). In this paper, we aim to address this issue and develop a network that can outperform not only the canonical transformers, but also the high-performance convolutional models. We propose a new transformer based hybrid network by taking advantage of transformers to capture long-range dependencies, and of CNNs to model local features. Furthermore, we scale it to obtain a family of models, called CMTs, obtaining much better accuracy and efficiency than previous convolution and transformer based models. In particular, our CMT-S achieves 83.5% top-1 accuracy on ImageNet, while being 14x and 2x smaller on FLOPs than the existing DeiT and EfficientNet, respectively. The proposed CMT-S also generalizes well on CIFAR10 (99.2%), CIFAR100 (91.7%), Flowers (98.7%), and other challenging vision datasets such as COCO (44.3% mAP), with considerably less computational cost.
연구 동기 및 목표
- CNN과 비전 트랜스포머 간의 성능-비용 격차를 고무하고 해소하기.
- 로컬 특징 추출을 위한 CNN과 장거리 의존성을 위한 트랜스포머를 활용하는 하이브리드 아키텍처를 제안합니다.
- 단계별 구조와 효율성 중심 블록을 갖춘 확장 가능한 CMT 모델 계열을 설계합니다.
제안 방법
- CMT 블록 전에 미세한 특징을 추출하기 위한 컨볼루션 스템을 도입합니다.
- Local Perception Unit (LPU), Lightweight Multi-head Self-Attention (LMHSA), Inverted Residual Feed-Forward Network (IRFFN)을 갖춘 CMT 블록을 개발합니다.
- 연산을 줄이기 위해 깊이wise 컨볼루션과 공간 축소를 활용한 경량 어텐션을 사용합니다.
- 밀도 작업에 적합한 다중 스케일 특징 맵을 생성하기 위해 단계별 아키텍처를 적용합니다.
- 모델 변형(CMT-Ti, XS, S, B 등)을 생성하기 위한 복합 확장 전략을 채택합니다.
- 분류를 위해 ViT의 클래스 토큰을 전역 평균 풀링으로 대체합니다.
실험 결과
연구 질문
- RQ1CNN 보강 트랜스포머 백본이 ImageNet 및 COCO에서 순수 CNN 및 순수 트랜스포머 모델보다 정확도와 효율성 면에서 앞설 수 있는가?
- RQ2하이브리드 CMT 블록에서 로컬 정보와 글로벌 정보가 표현 학습을 how 상호 작용하는가?
- RQ3단계별 설계와 제안된 확장 전략이 성능과 FLOPs에 미치는 영향은 무엇인가?
- RQ4CMT 백본이 객체 탐지 및 인스턴스 분할 작업으로 잘 전달되는가?
주요 결과
- CMT-S는 ImageNet에서 83.5% top-1 정확도와 4.0B FLOPs를 달성하며 DeiT-S 및 CPVT를 능가하고 EfficientNet-B4보다 더 적은 연산을 사용합니다.
- CMT 변형은 CIFAR-10/100, Flowers, COCO 등 다양한 데이터셋에서 강력한 성능을 보이며 정확도/FLOPs 균형이 우수합니다.
- 단계별 아키텍처와 LMHSA가 단일 스케일 ViT 백본과 비교해 계산량을 줄이면서 정확도를 유지하거나 향상시킵니다.
- CMT 블록의 컨볼루션 스템, LPU, IRFFN 및 숏컷 연결은 정확도를 크게 향상시키며 제거 시 +0.9%~ +1.1%의 증가를 보이는 경우가 있습니다.
- COCO에서 CMT-S는 RetinaNet으로 44.3% mAP를 달성하며 유사 FLOPs에서 다수의 CNN/ViT 기반 백본보다 우수합니다.
- 프리트레이닝을 ImageNet에서 수행한 경우 CIFAR 및 세밀한 데이터셋에서도 전달 학습 성능이 경쟁력 있음을 보여줍니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.