Skip to main content
QUICK REVIEW

[논문 리뷰] TopFormer: Token Pyramid Transformer for Mobile Semantic Segmentation

Wenqiang Zhang, Zilong Huang|arXiv (Cornell University)|2022. 04. 12.
Advanced Neural Network Applications인용 수 16
한 줄 요약

TopFormer는 모바일 환경에 최적화된 비전 트랜스포머 아키텍처로, 다중 해상도 특징을 추출하기 위해 토큰 피라미드 모듈을 사용하고, 스케일 인식 가능한 전역 표현을 로컬 토큰에 융합하기 위해 의미 정보 주입 메커니즘을 도입한다. 이는 이동 장치에서 레이턴시를 낮추면서도 MobileNetV3 대비 5% 높은 mIoU 성능을 달성하며, 타이니 버전은 ARM 기반 하드웨어에서 실시간 추론을 가능하게 한다.

ABSTRACT

Although vision transformers (ViTs) have achieved great success in computer vision, the heavy computational cost hampers their applications to dense prediction tasks such as semantic segmentation on mobile devices. In this paper, we present a mobile-friendly architecture named extbf{To}ken extbf{P}yramid Vision Trans extbf{former} ( extbf{TopFormer}). The proposed extbf{TopFormer} takes Tokens from various scales as input to produce scale-aware semantic features, which are then injected into the corresponding tokens to augment the representation. Experimental results demonstrate that our method significantly outperforms CNN- and ViT-based networks across several semantic segmentation datasets and achieves a good trade-off between accuracy and latency. On the ADE20K dataset, TopFormer achieves 5\% higher accuracy in mIoU than MobileNetV3 with lower latency on an ARM-based mobile device. Furthermore, the tiny version of TopFormer achieves real-time inference on an ARM-based mobile device with competitive results. The code and models are available at: https://github.com/hustvl/TopFormer

연구 동기 및 목표

  • 이동 장치를 위한 세그멘테이션에 특화된 경량이며 효율적인 비전 트랜스포머 아키텍처를 설계하기 위해.
  • 자원 제약이 있는 장치에서 밀도 있는 예측 작업에 대해 표준 트랜스포머의 높은 계산 비용 문제를 해결하기 위해.
  • ARM 기반 이동 CPU에서 MobileNetV3 대비 정확도를 높이면서도 레이턴시를 감소시키기 위해.
  • 모델 양자화나 GPU 가속 없이도 이동 장치에서 실시간 추론을 가능하게 하기 위해.
  • 객체 검출과 같은 다른 밀도 있는 예측 작업으로 아키텍처를 일반화하기 위해.

제안 방법

  • 토큰 피라미드 모듈은 고해상도 이미지를 처리하기 위해 스택된 경량 MobileNetV2 블록을 사용하며, 빠른 다운샘플링을 통해 다중 해상도 특징 토큰을 생성한다.
  • 의미 추출기(세미틱스 익스트랙터)는 평균 풀링을 사용해 다양한 스테이지의 토큰을 매우 낮은 해상도(예: 입력 크기의 1/64)로 풀링한 후, 이를 트랜스포머 블록에 입력하여 스케일 인식 가능한 전역 의미 정보를 학습한다.
  • 의미 정보 주입 모듈은 스케일 인식 가능한 전역 의미 정보를 채널별로 분할하고, 각 스케일에 해당하는 토큰에 다시 융합하여 표현력을 향상시킨다.
  • 주입된 토큰은 세그멘테이션 헤드의 입력으로 사용되어 최소한의 계산 오버헤드로 계층적 특징 학습을 가능하게 한다.
  • 트랜스포머 블록에 잔차 연결을 사용하여 전역 의미 정보의 스케일 인식 능력을 유지한다.
  • 모델은 ADE20K, Pascal Context, COCO-Stuff에서 평가하기 위해 세그멘테이션을 위한 교차 엔트로피 손실과 Dice 손실을 사용해 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1이동 CPU에서 세그멘테이션 작업에 대해 높은 정확도와 낮은 레이턴시를 동시에 달성할 수 있는 비전 트랜스포머를 설계할 수 있는가?
  • RQ2스케일 인식 가능한 전역 의미 정보를 효율적으로 추출하고 다중 해상도 특징에 주입하여 표현력을 향상시킬 수 있는가?
  • RQ3하이브리드 CNN-Transformer 아키텍처가 이동 장치에서 정확도와 추론 속도 양면에서 MobileNetV3를 초월할 수 있는가?
  • RQ4제안된 방법이 객체 검출과 같은 다른 밀도 있는 예측 작업으로 일반화될 수 있는가?
  • RQ5이동 장치 배포를 고려할 때 모델 크기, FLOPs, 추론 레이턴시 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • ADE20K 검증 세트에서 TopFormer-B는 오직 1.25 GFLOPs로 45.28% mIoU를 기록했으며, MobileNetV3 대비 5% 높은 성능을 보였고, 레이턴시도 감소시켰다.
  • TopFormer의 타이니 버전(TopFormer-T)은 ARM 기반의 스냅드래곤 865 CPU에서 110ms의 레이턴시로 실시간 추론을 달성했으며, 총 0.44 GFLOPs의 계산량을 사용했다.
  • Pascal Context에서 TopFormer-S는 배경 포함 60개 클래스에 대해 43.68% mIoU를 기록했으며, 백본은 0.80 GFLOPs, 헤드는 0.18 GFLOPs로, 이전의 모든 CNN 및 ViT 기반 방법을 능가했다.
  • COCO-Stuff에서 TopFormer-B는 1.38 GFLOPs로 33.43% mIoU를 기록했으며, 유사한 계산량을 가진 MobileNetV3 대비 8% 높은 성능을 보였다.
  • COCO에서의 객체 검출 작업에서 TopFormer-S 백본을 사용한 RetinaNet은 3.7 GFLOPs로 30.4% mAP를 기록했으며, FLOPs가 더 낮은 MobileNetV3 및 ShuffleNet보다도 뛰어난 성능을 보였다.
  • 의미 추출기의 실제 레이턴시 기여도는 총 파라미터의 74%를 차지하지만 뿐만 아니라 전체 레이턴시의 약 10%에 불과하여 계산 효율성이 매우 높음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.