Skip to main content
QUICK REVIEW

[논문 리뷰] MPViT: Multi-Path Vision Transformer for Dense Prediction

Youngwan Lee, Jonghee Kim|arXiv (Cornell University)|2021. 12. 21.
Advanced Neural Network Applications인용 수 14
한 줄 요약

MPViT는 다중 스케일 패치 임베딩을 갖춘 다중 경로 비전 트랜스포머를 제안하여 동일한 입력 이미지에서 미세한 및 굵은 시각적 특징을 병렬 트랜스포머 인코더를 통해 동시에 처리함으로써 ImageNet, COCO, ADE20K에서 기존 SOTA 비전 트랜스포머보다 더 적은 파라미터 수와 FLOPs로 최신 성능을 달성한다.

ABSTRACT

Dense computer vision tasks such as object detection and segmentation require effective multi-scale feature representation for detecting or classifying objects or regions with varying sizes. While Convolutional Neural Networks (CNNs) have been the dominant architectures for such tasks, recently introduced Vision Transformers (ViTs) aim to replace them as a backbone. Similar to CNNs, ViTs build a simple multi-stage structure (i.e., fine-to-coarse) for multi-scale representation with single-scale patches. In this work, with a different perspective from existing Transformers, we explore multi-scale patch embedding and multi-path structure, constructing the Multi-Path Vision Transformer (MPViT). MPViT embeds features of the same size~(i.e., sequence length) with patches of different scales simultaneously by using overlapping convolutional patch embedding. Tokens of different scales are then independently fed into the Transformer encoders via multiple paths and the resulting features are aggregated, enabling both fine and coarse feature representations at the same feature level. Thanks to the diverse, multi-scale feature representations, our MPViTs scaling from tiny~(5M) to base~(73M) consistently achieve superior performance over state-of-the-art Vision Transformers on ImageNet classification, object detection, instance segmentation, and semantic segmentation. These extensive results demonstrate that MPViT can serve as a versatile backbone network for various vision tasks. Code will be made publicly available at \url{https://git.io/MPViT}.

연구 동기 및 목표

  • 조밀한 예측 작업에서 다중 스케일 특징 이해가 필요한 데에 단일 스케일 패치 표현의 한계를 해결하기 위해.
  • CoaT와 같은 기존 공통 스케일 메커니즘의 계산 및 메모리 오버헤드를 극복하기 위해 다중 스케일 특징의 병렬적이고 독립적인 처리를 가능하게 하기 위해.
  • 다중 병렬 트랜스포머 경로와 함께 겹치는 컨볼루션 패치 임베딩을 통합하여 특징 표현의 다양성을 향상시키기 위해.
  • 컨볼루션의 국소적 인덕티브 바이어스와 자기주의에서 유도된 전역적 맥락을 결합하기 위해 효과적인 전역-국소 특징 상호작용을 가능하게 하기 위해.
  • 모델 복잡도를 감소시켜 여러 비전 벤치마크에서 일관되게 SOTA 비전 트랜스포머를 능가하는 유연한 백본을 개발하기 위해.

제안 방법

  • 다양한 커널 크기(예: 3×3, 5×5, 7×7)를 갖는 겹치는 컨볼루션 패치 임베딩을 사용하여 동일한 입력 이미지에서 다중 스케일 패치를 추출하고 일관된 시퀀스 길이를 유지한다.
  • 다른 패치 스케일에서 유도된 토큰을 별도의 병렬 트랜스포머 인코더 경로에 입력하여 각 스케일에서 독립적인 전역 자기주의 계산을 가능하게 한다.
  • 국소 컨볼루션 특징과 전역 트랜스포머 특징을 결합하는 글로벌-국소 특징 상호작용(Goal-to-Local Interaction, GLI) 메커니즘을 사용해 다중 경로의 특징을 통합한다.
  • 각 경로가 특정 수신장 범위에 특화되도록 다중 경로 아키텍처를 설계한다—경로-1은 미세한 세부 사항에 특화되고, 경로-3은 굵은 의미 정보에 특화되며, 경로-2는 중간 스케일에 특화된다.
  • ImageNet-1K에서 표준 DeiT 스타일 레시피를 사용해 모델을 훈련한 후, COCO와 ADE20K에서 검출, 세분화, 분류 작업을 위해 미세조정한다.
  • 각 경로의 주의 맵을 시각화하여 스케일별 주의 행동을 분석하고 상호 보완적 특징 학습을 검증한다.

실험 결과

연구 질문

  • RQ1다중 경로 트랜스포머 아키텍처에서 다중 스케일 패치 임베딩이 조밀한 예측 작업을 위한 특징 표현 다양성 향상에 기여하는가?
  • RQ2여러 벤치마크에서 정확도, 파라미터 수, FLOPs 측면에서 MPViT의 성능은 SOTA 비전 트랜스포머와 비교해 어떻게 되는가?
  • RQ3MPViT의 개별 경로가 서로 다른 크기나 의미 수준의 객체에 주로 주의를 기울이는가?
  • RQ4글로벌-국소 특징 상호작용 메커니즘이 다중 경로 환경에서 국소적 인덕티브 바이어스와 전역 자기주의를 효과적으로 통합하는가?
  • RQ5MPViT의 실패 모드는 무엇이며, 주의 맵은 잘못된 분류 사례와 어떻게 관련되어 있는가?

주요 결과

  • MPViT-Small(22M 파라미터, 4 GFLOPs)는 COCO 마스크 AP 43.9를 달성하여 더 큰 Focal-Base 모델(89M 파라미터, 16 GFLOPs)의 43.7 AP를 초월한다.
  • ImageNet-1K에서 MPViT-Tiny(5M 파라미터)는 83.5%의 Top-1 정확도를 기록하여 Swin-B 및 CoaT-Lite-S와 같은 SOTA 비전 트랜스포머를 능가한다.
  • 글로벌-국소 특징 상호작용 메커니즘은 컨볼루션에서 유도된 국소 세부 정보와 자기주의에서 기인한 전역 맥락을 결합함으로써 특징 품질을 향상시킨다.
  • 시각적 분석 결과 경로-1은 작은 객체와 질감에 집중하고, 경로-3는 큰 객체와 의미적 개념에 초점을 맞추며, 경로-2는 중간 수준의 행동을 보임을 확인했다.
  • 실패 분석 결과, 주의 맵이 유사한 의미적 객체(예: 포크리프트 vs. 트레일러 트럭)에 강한 주의를 기울일 경우 예측을 잘못 이끌어내는 경향이 있음을 확인했으며, 이는 주의 맵이 모델 예측과 상관이 있음을 시사한다.
  • MPViT는 인스턴스 세분화(COCO), 의미 세분화(ADE20K), 객체 검출(COCO)에서 최신 성능을 기록하여 백본으로서의 유연성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.