[논문 리뷰] EdgeViTs: Competing Light-weight CNNs on Mobile Devices with Vision Transformers
EdgeViTs는 자기주의 주의와 깊이 분리형 컨볼루션을 조합한 지역-전역-지역(LGL) 주의 메커니즘을 통합하여 모바일 장치에서 최신의 효율적인 CNN보다 뛰어난 경량 비전 트랜스포머의 새로운 가족을 소개한다. 이 모델들은 정확도-지연 및 정확도-에너지 무게 조정에서 파레토 최적의 성능을 달성하며, 실제 하드웨어에서 이미지 분류, 객체 검출, 세그멘테이션 작업 전반에서 이전에 유일하게 모바일을 위한 것으로 설계된 MobileViTs를 뛰어넘는다.
Self-attention based models such as vision transformers (ViTs) have emerged as a very competitive architecture alternative to convolutional neural networks (CNNs) in computer vision. Despite increasingly stronger variants with ever-higher recognition accuracies, due to the quadratic complexity of self-attention, existing ViTs are typically demanding in computation and model size. Although several successful design choices (e.g., the convolutions and hierarchical multi-stage structure) of prior CNNs have been reintroduced into recent ViTs, they are still not sufficient to meet the limited resource requirements of mobile devices. This motivates a very recent attempt to develop light ViTs based on the state-of-the-art MobileNet-v2, but still leaves a performance gap behind. In this work, pushing further along this under-studied direction we introduce EdgeViTs, a new family of light-weight ViTs that, for the first time, enable attention-based vision models to compete with the best light-weight CNNs in the tradeoff between accuracy and on-device efficiency. This is realized by introducing a highly cost-effective local-global-local (LGL) information exchange bottleneck based on optimal integration of self-attention and convolutions. For device-dedicated evaluation, rather than relying on inaccurate proxies like the number of FLOPs or parameters, we adopt a practical approach of focusing directly on on-device latency and, for the first time, energy efficiency. Specifically, we show that our models are Pareto-optimal when both accuracy-latency and accuracy-energy trade-offs are considered, achieving strict dominance over other ViTs in almost all cases and competing with the most efficient CNNs. Code is available at https://github.com/saic-fi/edgevit.
연구 동기 및 목표
- 경량 비전 트랜스포머(ViTs)와 최신의 효율적인 CNN 간의 성능 격차를 모바일 및 엣지 장치에서 해소하기 위해.
- 기존 ViT의 모바일 배포 제약을 해결하기 위해, FLOPs와 같은 대체 지표가 아닌 실제 효율성 지표인 현장 내 지연 및 에너지 소비를 중심으로 접근하기 위해.
- 사용자 지정 연산 없이도 표준 딥 러닝 프레임워크를 사용해도 바로 배포 가능한 컴퓨팅 효율성이 높고 구현이 용이한 ViT 아키텍처를 설계하기 위해.
- 낮은 추론 비용을 유지하면서도 밀도 높은 예측 작업(객체 검출, 세그멘테이션)에서 경쟁 가능한 성능을 달성하기 위해.
제안 방법
- 자기주의 주의와 깊이 분리형 컨볼루션을 체계적이고 비용 효율적으로 통합한 지역-전역-지역(LGL) 정보 교환 버티브를 제안한다.
- 자기주의 주의를 지역, 전역, 재결합 단계로 분해하여 계산 복잡도를 줄이면서도 장거리 모델링 능력을 유지한다.
- CNN을 영감으로 삼아 공간 해상도를 단계적으로 감소시키는 계층적 다단계 아키텍처를 사용하여 시퀀스 길이를 제어하고 이차적 복잡도를 줄인다.
- 지역 특징 모델링을 향상시키고 파라미터 효율성을 높이기 위해 깊이 분리형 컨볼루션을 통합한다.
- ONNX, TensorRT 등 표준 딥 러닝 프레임워크를 사용해 직접 배포 가능한 모델을 설계하여 구현 우수성과 높은 현장 내 추론 속도를 확보한다.
- ImageNet-1K에서 학습하고 COCO 및 ADE20K에서 표준 프로토콜을 사용해 미세조정하여 다양한 비전 작업에서의 성능을 평가한다.
실험 결과
연구 질문
- RQ1비전 트랜스포머가 정확도와 현장 내 추론 효율성 측면에서 최고의 경량 CNN과 견줄 수 있도록 충분히 효율적으로 만들 수 있는가?
- RQ2자기주의 주의 메커니즘에 지역 컨볼루션을 통합하면 정확도를 손상시키지 않고도 모바일 하드웨어에서 효율성을 크게 향상시킬 수 있는가?
- RQ3FLOPs와 같은 대체 지표와 비교해 실제 지표인 현장 내 지연 및 에너지 소비는 모바일 배포에서의 모델 효율성 예측에 얼마나 더 유의미한가?
- RQ4사용자 지정 프레임워크 최적화 없이도 표준 딥 러닝 프레임워크를 사용해도 바로 배포 가능한 ViT 기반 아키텍처를 설계할 수 있는가?
- RQ5CNN과 일반적인 ViT와 비교해 비전 트랜스포머가 정확도-지연 및 정확도-에너지 무게 조정에서 파레토 최적성을 얼마나 잘 달성할 수 있는가?
주요 결과
- EdgeViT-XXS는 ADE20K 세그멘테이션에서 39.7% mIoU를 기록하여, 유사한 GFLOPs와 파라미터 수를 가진 PVTv2-B0보다 2.5% 포인트 높은 성능을 보였다.
- EdgeViT-S는 ADE20K에서 45.9% mIoU를 기록하여, PVTv2-B1을 3.4% 포인트 뛰어넘었으며, 이는 밀도 높은 예측 작업에서 강력한 성능을 보임을 시사한다.
- RetinaNet 기반 COCO 객체 검출에서 EdgeViT-XXS는 PVTv2-B0보다 1.5 AP 높은 성능을 보였고, Mask R-CNN 기반 마스크 세그멘테이션에서는 1.7 AP 높은 성능을 기록했다.
- Samsung Galaxy S21에서 EdgeViT-XXS는 33.3ms 내로 실행되었으며, 더 높은 GFLOPs를 가진 EfficientNet-B0(52.1ms)보다 빠르게 동작하여 현장 내 효율성이 뛰어나다는 것을 입증했다.
- EdgeViTs는 다른 ViT들과 비교해 정확도-지연 및 정확도-에너지 무게 조정에서 엄청난 우위를 점하며, 에너지 소비는 EfficientNet-B0와 약간 뿐이었다.
- 이 모델들은 평가된 모든 지표에서 파레토 최적성을 달성했으며, 이전에 유일하게 모바일을 위한 것으로 설계된 MobileViTs를 모든 벤치마크와 효율성 지표에서 모두 뛰어넘었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.