Skip to main content
QUICK REVIEW

[논문 리뷰] SimMIM: A Simple Framework for Masked Image Modeling

Zhenda Xie, Zheng Zhang|arXiv (Cornell University)|2021. 11. 18.
Advanced Neural Network Applications참고 문헌 59인용 수 15
한 줄 요약

SimMIM은 무작위로 이미지 패치를 마스킹하고 가벼운 선형 헤드를 사용해 원본 픽셀 값을 회귀함으로써 상태의 기술(SOTA) 성능을 달성하는 단순한 마스킹된 이미지 모델링 프레임워크를 제안한다. ℓ₁ 손실을 사용한다. ImageNet-1K에서 ViT-B를 사용할 경우 83.8%의 top-1 정확도를 기록했으며, SwinV2-H를 사용할 경우 87.1%를 기록하여 이전 방법들을 능가한다. 이는 복잡한 설계 요소인 이산 VAE나 블록 단위 마스킹을 제거함으로써 달성되었다.

ABSTRACT

This paper presents SimMIM, a simple framework for masked image modeling. We simplify recently proposed related approaches without special designs such as block-wise masking and tokenization via discrete VAE or clustering. To study what let the masked image modeling task learn good representations, we systematically study the major components in our framework, and find that simple designs of each component have revealed very strong representation learning performance: 1) random masking of the input image with a moderately large masked patch size (e.g., 32) makes a strong pre-text task; 2) predicting raw pixels of RGB values by direct regression performs no worse than the patch classification approaches with complex designs; 3) the prediction head can be as light as a linear layer, with no worse performance than heavier ones. Using ViT-B, our approach achieves 83.8% top-1 fine-tuning accuracy on ImageNet-1K by pre-training also on this dataset, surpassing previous best approach by +0.6%. When applied on a larger model of about 650 million parameters, SwinV2-H, it achieves 87.1% top-1 accuracy on ImageNet-1K using only ImageNet-1K data. We also leverage this approach to facilitate the training of a 3B model (SwinV2-G), that by $40 imes$ less data than that in previous practice, we achieve the state-of-the-art on four representative vision benchmarks. The code and models will be publicly available at https://github.com/microsoft/SimMIM.

연구 동기 및 목표

  • 이산 VAE, 클러스터링, 블록 단위 마스킹 등의 복잡한 구성 요소를 제거함으로써 마스킹된 이미지 모델링을 단순화하는 것.
  • 무작위 마스킹, 원본 픽셀 회귀, 가벼운 헤드와 같은 단순한 설계가 강력한 표현 학습을 이끌 수 있는지 조사하는 것.
  • 다양한 비전 작업과 모델 규모, 특히 데이터 효율적 훈련 환경에서 SimMIM의 효과성을 평가하는 것.
  • 더 복잡한 자기지도 학습 방법에 비해 성능이 유사하거나 이를 초월할 수 있음을 보여주는 것.

제안 방법

  • 고정된 패치 크기(예: 32×32)와 10%에서 70% 사이의 마스킹 비율을 사용해 이미지 패치를 무작위로 마스킹한다.
  • 가벼운 1층 피드포워드 헤드를 사용해 마스킹된 패치의 원래 RGB 픽셀 값을 직접 회귀 예측한다.
  • 예측값과 진짜 픽셀 값 간의 단순 ℓ₁ 손실을 사용해 모델을 훈련한다.
  • 일반화 성능 평가를 위해 비전 트랜스포머(ViT, Swin)와 ResNets를 백본으로 사용한다.
  • 추론 시 다중 척도 테스트를 적용하고, 사전 훈련 중 표준 데이터 증강 기법을 사용한다.
  • ImageNet-1K 분류, COCO 객체 검출, ADE20K 세그멘테이션 등의 다운스트림 작업에서 평가한다.
Figure 1 : An illustration of our simple framework for masked language modeling, named SimMIM . It predicts raw pixel values of the randomly masked patches by a lightweight one-layer head, and performs learning using a simple $\ell_{1}$ loss.
Figure 1 : An illustration of our simple framework for masked language modeling, named SimMIM . It predicts raw pixel values of the randomly masked patches by a lightweight one-layer head, and performs learning using a simple $\ell_{1}$ loss.

실험 결과

연구 질문

  • RQ1큰 패치 크기를 사용한 무작위 마스킹이 비전 트랜스포머에서 효과적인 표현 학습을 이끌 수 있는가?
  • RQ2복잡한 토큰화 기법을 사용하지 않은 직접적인 원본 픽셀 값 회귀가 분류 기반 마스킹 모델링보다 성능이 뛰어날 수 있는가?
  • RQ3간단한 예측 헤드(예: 선형 레이어)가 강력한 전이 성능을 내는 데에 충분한가?
  • RQ4SimMIM은 모델 크기와 데이터 제약 조건에 따라 어떻게 스케일링되는가? 특히 라벨이 제한된 데이터에서 어떻게 성능을 내는가?
  • RQ5마스킹 전략(예: 가장 가까운 가시 패치까지의 평균 거리)이 다운스트림 성능에 미치는 영향은 무엇인가?

주요 결과

  • ViT-B를 사용할 경우 SimMIM은 ImageNet-1K에서 83.8%의 top-1 정확도를 기록하여 이전 SOTA보다 +0.6% 높다.
  • SwinV2-H(658M 파rameters)를 사용할 경우 SimMIM은 ImageNet-1K 데이터만으로 87.1%의 top-1 정확도를 달성한다.
  • SimMIM을 사용해 훈련한 3B 파라미터의 SwinV2-G 모델은 이전 방법보다 40배 적은 라벨 데이터를 사용해 네 가지 비전 벤치마크에서 SOTA 성능을 기록했다.
  • 선형 예측 헤드가 더 깊은 헤드(예: 역전이 Swin-T)보다 ImageNet-1K에서 +0.4% 높고, ADE20K에서 +0.6% 높은 성능을 보이며, 단순함이 일반화 성능을 향상시킨다는 것을 시사한다.
  • 원본 픽셀 회귀에 ℓ₁ 손실을 사용할 경우, 8~256개의 색상 박스로 이진화하거나 클러스터링한 분류 타겟보다 동일하거나 더 우수한 성능을 내며, 이는 복잡한 타겟 설계가 필요 없음을 의미한다.
  • 마스킹된 패치와 가시 패치 사이의 평균 거리(AvgDist)가 약 15픽셀일 때 최적의 성능을 기록하며, 이는 국소적 맥락과 전반적 구조 사이의 균형을 잘 반영하고 있음을 시사한다.
Figure 2 : Illustration of masking area generated by different masking strategies using a same mask ratio of 0.6: square masking [ 38 ] , block-wise masking [ 1 ] apply on 16-sized patches, and our simple random masking strategy on different patch sizes (e.g., 4, 8, 16 and 32).
Figure 2 : Illustration of masking area generated by different masking strategies using a same mask ratio of 0.6: square masking [ 38 ] , block-wise masking [ 1 ] apply on 16-sized patches, and our simple random masking strategy on different patch sizes (e.g., 4, 8, 16 and 32).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.