Skip to main content
QUICK REVIEW

[논문 리뷰] A Unified View of Masked Image Modeling

Zhiliang Peng, Dong Li|arXiv (Cornell University)|2022. 10. 19.
Advanced Neural Network Applications인용 수 14
한 줄 요약

이 논문은 CLIP 기반의 교사 모델에서 마스킹된 이미지 패치에서 정규화된 의미 특징을 재구성함으로써, 완전히 연결된 MIM 헤드와 Smooth-$\ell_1$ 손실을 사용하는 학생 비전 트랜스포머를 활용하는 간단하면서도 효과적인 마스킹된 이미지 모델링 방법인 MaskDistill을 제안한다. 이는 300 에포크의 사전훈련 후 ViT-H/14 모델을 사용하여 ImageNet-1k에서 88.3%의 top-1 정확도와 ADE20k에서 58.8%의 mIoU를 달성하며 최신 기술 수준을 확보한다.

ABSTRACT

Masked image modeling has demonstrated great potential to eliminate the label-hungry problem of training large-scale vision Transformers, achieving impressive performance on various downstream tasks. In this work, we propose a unified view of masked image modeling after revisiting existing methods. Under the unified view, we introduce a simple yet effective method, termed as MaskDistill, which reconstructs normalized semantic features from teacher models at the masked positions, conditioning on corrupted input images. Experimental results on image classification and semantic segmentation show that MaskDistill achieves comparable or superior performance than state-of-the-art methods. When using the huge vision Transformer and pretraining 300 epochs, MaskDistill obtains 88.3% fine-tuning top-1 accuracy on ImageNet-1k (224 size) and 58.8% semantic segmentation mIoU metric on ADE20k (512 size). The code and pretrained models will be available at https://aka.ms/unimim.

연구 동기 및 목표

  • 대규모 비전 트랜스포머 훈련에서의 레이블 의존 문제를 해결하기 위해 통합된 마스킹된 이미지 모델링(MIM) 프레임워크를 제안하는 것.
  • 기존 MIM 방법들 사이의 핵심 구성 요소를 규명하고, 그들의 설계 공간에 대한 체계적이고 통합된 시각을 확립하는 것.
  • 복잡한 아키텍처 수정 없이도 성능을 향상시키는 단순하면서도 효과적인 MIM 방법인 MaskDistill을 개발하는 것.
  • 강력한 교사 모델에서 정규화된 의미 특징을 힘겨워하는 것이 더 나은 일반화와 후행 작업 성능을 이끌어내는지 확인하는 것.

제안 방법

  • 이 방법은 교사 모델, 정규화 레이어, 학생 모델, MIM 헤드, 손실 함수로 구성된 통합된 MIM 프레임워크에 기반한다.
  • MaskDistill은 마스킹된 패치에서 고수준의 정규화된 특징 표현을 제공하기 위해 CLIP의 ViT-B/16을 교사 모델로 사용한다.
  • 학생 모델은 손상된 입력 패치를 취하고, 교사 모델의 해당 위치에서의 정규화된 특징 벡터를 예측하는 비전 트랜스포머(ViT)이다.
  • 완전히 연결된 MIM 헤드는 학생의 표현을 마스킹된 위치에서 교사의 정규화된 특징 벡터와 일치시키기 위해 디코딩한다.
  • 훈련의 안정성과 정렬 향상을 위해 교사의 출력 특징에 층 정규화를 적용한다.
  • 예측된 특징과 목표 정규화된 특징 간의 차이를 측정하기 위해 Smooth-$\ell_1$ 손실 함수를 사용하여 이상치에 대한 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1기존의 다양한 마스킹된 이미지 모델링 방법들의 설계를 어떻게 공통 프레임워크로 통합할 수 있는가?
  • RQ2교사 모델의 선택이 마스킹된 이미지 모델링 성능에 어떤 역할을 하는가?
  • RQ3강력한 교사 모델에서 정규화된 의미 특징을 재구성하는 단순한 MIM 방법이 특수 설계된 복잡한 아키텍처를 능가할 수 있는가?
  • RQ4원시 픽셀이나 이산 토큰이 아닌 정규화된 특징을 힘겨워하는 것이 더 나은 일반화와 후행 작업 성능을 이끌어내는가?

주요 결과

  • ViT-H/14 모델을 사용해 300 에포크의 사전훈련 후 MaskDistill은 ImageNet-1k에서 88.3%의 top-1 정확도를 달성하며 최신 기술 수준의 방법들을 능가하거나 견줄 만하다.
  • ADE20k 세그멘테이션 벤치마크에서 MaskDistill은 58.8%의 mIoU를 기록하여 조밀한 예측 작업으로의 강력한 전이 가능성을 보여준다.
  • 스타일링된 ImageNet 변형에서의 일반화 성능 향상으로 인해 학습된 표현의 형태 편향이 향상됨을 입증하여, 이로 인해 강건성이 높아졌음을 설명할 수 있다.
  • 제거 분석 결과, CLIP 교사 모델의 정규화된 특징를 사용하는 것이 원시 픽셀이나 다른 감독 신호보다 더 효과적임을 확인했다.
  • 기본, 대형, 초대형 등 다양한 모델 크기에서 일관된 성능 향상이 나타나, 이 방법의 확장성과 강건성을 입증한다.
  • CLIP이 다중모odal 모델임에도 불구하고 언어 감독 없이도 후행 작업으로의 일반화가 잘 되어 있음을 보여주며, 이는 강력한 일반화 능력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.