Skip to main content
QUICK REVIEW

[논문 리뷰] Unleashing Vanilla Vision Transformer with Masked Image Modeling for Object Detection

Y.K. Fang, Shusheng Yang|arXiv (Cornell University)|2022. 04. 06.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 객체 검출을 위해 마스크된 이미지 모델링(MIM)으로 사전 훈련된 순수한 비전 트랜스포머(ViT)를 적응시키는 새로운 객체 검출 프레임워크 MimDet를 제안한다. 미세조정 중에 입력 임bedding의 25–50%만 무작위로 샘플링하여 입력으로 제공함으로써, 이는 기존의 패치 파트리션 스템을 사용하지 않으면서도 다중 스케일 특징 추출을 가능하게 하기 위해 무작위로 초기화된 컨볼루션 스템으로 대체된 MIM 사전 훈련된 ViT를 활용한다. 이로 인해 COCO에서 54.3 AP⁠⁠box와 48.2 AP⁠⁠mask를 달성하며, 계층적 Swin 트랜스포머보다 각각 2.5와 2.6 AP 높은 성능을 기록했고, 더 단순한 미세조정 레시피를 사용함에도 불구하고 수렴 속도가 2.8배 빠르다.

ABSTRACT

We present an approach to efficiently and effectively adapt a masked image modeling (MIM) pre-trained vanilla Vision Transformer (ViT) for object detection, which is based on our two novel observations: (i) A MIM pre-trained vanilla ViT encoder can work surprisingly well in the challenging object-level recognition scenario even with randomly sampled partial observations, e.g., only 25% $\sim$ 50% of the input embeddings. (ii) In order to construct multi-scale representations for object detection from single-scale ViT, a randomly initialized compact convolutional stem supplants the pre-trained large kernel patchify stem, and its intermediate features can naturally serve as the higher resolution inputs of a feature pyramid network without further upsampling or other manipulations. While the pre-trained ViT is only regarded as the 3$^{rd}$-stage of our detector's backbone instead of the whole feature extractor. This results in a ConvNet-ViT hybrid feature extractor. The proposed detector, named MIMDet, enables a MIM pre-trained vanilla ViT to outperform hierarchical Swin Transformer by 2.5 box AP and 2.6 mask AP on COCO, and achieves better results compared with the previous best adapted vanilla ViT detector using a more modest fine-tuning recipe while converging 2.8$ imes$ faster. Code and pre-trained models are available at https://github.com/hustvl/MIMDet.

연구 동기 및 목표

  • MIM 사전 훈련된 순수한 ViT가 아키텍처 수정 없이 객체 검출에 효과적으로 적응될 수 있는지 조사하는 것.
  • 순수한 ViT가 다중 스케일 객체 검출에 적합한 단일 스케일 특징 표현을 가지는 문제를 해결하는 것.
  • 창문 어텐션을 피하는 것으로 MIM 사전 훈련과 검출 미세조정 간의 분포 갭을 최소화하는 것.
  • 이전의 ViT 기반 검출기보다 더 단순하고 빠른 미세조정 레시피를 사용하여 효율적이고 고성능의 검출을 가능하게 하는 것.

제안 방법

  • ViT의 사전 훈련된 대규모 커널 패치 파트리션 스템을 다중 스케일 특징을 생성하기 위해 다중 스케일 특징 추출을 가능하게 하기 위해 무작위로 초기화된 컴act한 컨볼루션 스템으로 교체한다.
  • 미세조정 중에 MIM 사전 훈련된 ViT 인코더에 무작위로 샘플된 입력 임베딩의 25–50%만 제공하고, 나머지는 마스킹 토큰으로 간주한다.
  • 마스킹된 입력에서 전체 특징 맵을 재구성하기 위해 경량 디코더를 사용하며, 이는 검출 미세조정 중에 암묵적으로 MIM을 수행하는 방식이다.
  • 컨볼루션 스템의 중간 특징을 표준 특징 피라미드 네트워크(FPN)의 고해상도 입력으로 활용하여 업샘플링이 필요 없도록 한다.
  • ViT 인코더를 하이브리드 컨볼루션 네트워크-ViT 백본의 세 번째 스테이지로 간주하고, 전체 특징 추출기로 사용하지는 않는다.
  • 표준 마스크 R-CNN을 검출 헤드로 사용하며, 최소한의 데이터 증강과 36 에포크의 미세조정 스케줄을 적용한다.

실험 결과

연구 질문

  • RQ1MIM 사전 훈련된 순수한 ViT가 부분 입력 시퀀스만으로 미세조정될 경우 객체 검출에 효과적으로 일반화될 수 있는가?
  • RQ2사전 훈련된 패치 파트리션 스템을 무작위로 초기화된 컨볼루션 스템으로 교체함으로써 객체 검출을 위한 효과적인 다중 스케일 표현 학습이 가능해지는가?
  • RQ3더 적은 에포크 수와 덜한 데이터 증강을 사용하는 더 단순한 미세조정 레시피로도 MIM 사전 훈련된 ViT를 사용하여 최신 기술 성능을 달성할 수 있는가?
  • RQ4MIM 사전 훈련과 검출 미세조정 간의 분포 갭은 성능에 영향을 미치는가? 창문 어텐션을 피하는 것으로 이를 줄일 수 있는가?

주요 결과

  • MimDet는 36개의 미세조정 에포크만으로 기저 크기의 모델을 사용하여 COCO 객체 검출 및 인스턴스 세그멘테이션에서 54.3 AP⁠⁠box와 48.2 AP⁠⁠mask를 달성한다.
  • 동일한 평가 프로토콜 하에서 계층적 Swin 트랜스포머보다 각각 2.5 AP⁠⁠box와 2.6 AP⁠⁠mask 높은 성능을 기록한다.
  • 더 모범적인 미세조정 레시피를 사용함에도 불구하고, 이전에 성능이 가장 좋았던 순수한 ViT 기반 검출기보다 2.8배 더 빠르게 수렴한다.
  • 일반적으로 높은 훈련 비용을 유발하는 상대적 위치 편향 없이도 강력한 성능 유지를 유지한다.
  • 단지 경량 컨볼루션 스템과 부분 입력 샘플링만을 사용하여 최소한의 아키텍처 수정으로 최신 기술 성능을 달성한다.
  • 결과적으로 MIM 사전 훈련된 순수한 ViT가 백본 재설계나 복잡한 어텐션 메커니즘 도입 없이도 객체 수준의 인식에 효과적으로 활용될 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.