Skip to main content
QUICK REVIEW

[논문 리뷰] MoCoViT: Mobile Convolutional Vision Transformer

Hailong Ma, Xin Xia|arXiv (Cornell University)|2022. 05. 25.
Visual Attention and Saliency Detection인용 수 14
한 줄 요약

MoCoViT는 이동 기기에서 효율적인 시각 작업을 위해 설계된 경량 모바일 컨volution 뷰어 트랜스포머를 소개한다. 이는 이동 기기 우월한 컨볼루션 네트워크와 특수화된 트랜스포머 블록을 결합하여, 이동 기기에서의 효율적인 시각 처리를 가능하게 한다. 모바일 자체 주의(MoSA)와 모바일 피드포워드 네트워크(MoFFN)를 활용하여, 147M FLOPs에서 ImageNet의 상위 1위 정확도 74.5%를 달성하였으며, 이는 MobileNetV3를 뛰어넘고, COCO 객체 검출에서 GhostNet보다 2.1 AP 높은 성능을 기록하였다.

ABSTRACT

Recently, Transformer networks have achieved impressive results on a variety of vision tasks. However, most of them are computationally expensive and not suitable for real-world mobile applications. In this work, we present Mobile Convolutional Vision Transformer (MoCoViT), which improves in performance and efficiency by introducing transformer into mobile convolutional networks to leverage the benefits of both architectures. Different from recent works on vision transformer, the mobile transformer block in MoCoViT is carefully designed for mobile devices and is very lightweight, accomplished through two primary modifications: the Mobile Self-Attention (MoSA) module and the Mobile Feed Forward Network (MoFFN). MoSA simplifies the calculation of the attention map through Branch Sharing scheme while MoFFN serves as a mobile version of MLP in the transformer, further reducing the computation by a large margin. Comprehensive experiments verify that our proposed MoCoViT family outperform state-of-the-art portable CNNs and transformer neural architectures on various vision tasks. On ImageNet classification, it achieves 74.5% top-1 accuracy at 147M FLOPs, gaining 1.2% over MobileNetV3 with less computations. And on the COCO object detection task, MoCoViT outperforms GhostNet by 2.1 AP in RetinaNet framework.

연구 동기 및 목표

  • 이동 기기에서 저연산 비용으로 최적화된 시각 트랜스포머 아키텍처를 설계하기 위해.
  • 실제 이동 기기 응용 프로그램에서 기존의 이동성 있는 CNN과 시각 트랜스포머보다 정확도와 효율성을 향상시키기 위해.
  • 경량이며 이동 기기 중심의 프레임워크에서 컨볼루션 네트워크와 트랜스포머의 장점을 통합하기 위해.
  • 성능을 훼손하지 않으면서 주의 및 피드포워드 구성 요소의 FLOPs를 줄이기 위해.

제안 방법

  • 주의 맵 계산을 단순화하기 위해 분기 공유 기법을 사용하는 모바일 자체 주의(MoSA) 모듈을 도입한다.
  • 피드포워드 경로의 계산을 줄이는 경량 MLP 변종인 모바일 피드포워드 네트워크(MoFFN)를 제안한다.
  • 하이브리드 컨볼루션-트랜스포머 아키텍처에서 사용 가능한 이동 기기 최적화된 트랜스포머 블록에 MoSA와 MoFFN를 통합한다.
  • 이ндัก티브 바이어스와 장거리 모델링을 균형 있게 유지하기 위해 이동 기반 컨볼루션과 경량 트랜스포머 블록을 조합한 하이브리드 백본을 사용한다.
  • 표준 벤치마크를 사용하여 비교를 위해 ImageNet에서 MoCoViT 패밀리 훈련 및 COCO 검출에서 미세 조정을 수행한다.

실험 결과

연구 질문

  • RQ1정확도를 희생시키지 않고도 이동 기기 배포에 적합한 성능을 내는 시각 트랜스포머를 설계할 수 있는가?
  • RQ2성능을 유지하면서 이동 기기 하드웨어에 적합하도록 자기 주의 및 피드포워드 구성 요소를 어떻게 단순화할 수 있는가?
  • RQ3하이브리드 이동 기반 컨볼루션과 트랜스포머 아키텍처가 ImageNet과 COCO에서 최신 기술 대비 우수한 성능을 낼 수 있는가?
  • RQ4이동 네트워크에 트랜스포머 블록을 통합할 때 FLOPs와 정확도 사이의 상호 교환 관계는 어떠한가?

주요 결과

  • MoCoViT는 147M FLOPs에서 ImageNet에서 상위 1위 정확도 74.5%를 달성하였으며, 이는 더 낮은 연산량으로 MobileNetV3를 1.2% 뛰어넘었다.
  • RetinaNet를 사용한 COCO 객체 검출 작업에서 MoCoViT는 GhostNet보다 AP를 2.1 포인트 향상시켰다.
  • 모바일 자체 주의(MoSA) 모듈은 정확도에 큰 손실 없이 공유 분기 메커니즘을 통해 주의 계산을 줄였다.
  • 모바일 피드포워드 네트워크(MoFFN)는 표준 피드포워드 레이어에 비해 MLP 경로의 FLOPs를 크게 감소시켰다.
  • MoCoViT 패밀리는 여러 시각 벤치마크에서 최신 기술 기반의 이동 기반 CNN과 시각 트랜스포머를 모두 압도하는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.