Skip to main content
QUICK REVIEW

[논문 리뷰] SupMAE: Supervised Masked Autoencoders Are Efficient Vision Learners

Feng Liang, Yangguang Li|arXiv (Cornell University)|2022. 05. 28.
Human Pose and Action Recognition인용 수 14
한 줄 요약

SupMAE는 가시 패치의 일부만 사용하여 마스크된 이미지 복원과 감독 분류를 동시에 최적화하는 새로운 감독형 마스크된 오토인코더를 제안한다. 이는 ViT 사전학습을 향상시키며, 상태의 기술 수준을 넘어선 효율성과 강건성을 달성한다. 400 에포크 만에 ImageNet에서 83.6%의 정확도를 기록했으며, MAE가 요구하는 3배 적은 1600 에포크보다 훨씬 적다. 또한 전이 학습 및 강건성 벤치마크에서 MAE와 표준 감독 사전학습을 모두 능가한다.

ABSTRACT

Recently, self-supervised Masked Autoencoders (MAE) have attracted unprecedented attention for their impressive representation learning ability. However, the pretext task, Masked Image Modeling (MIM), reconstructs the missing local patches, lacking the global understanding of the image. This paper extends MAE to a fully supervised setting by adding a supervised classification branch, thereby enabling MAE to learn global features from golden labels effectively. The proposed Supervised MAE (SupMAE) only exploits a visible subset of image patches for classification, unlike the standard supervised pre-training where all image patches are used. Through experiments, we demonstrate that SupMAE is not only more training efficient but it also learns more robust and transferable features. Specifically, SupMAE achieves comparable performance with MAE using only 30% of compute when evaluated on ImageNet with the ViT-B/16 model. SupMAE's robustness on ImageNet variants and transfer learning performance outperforms MAE and standard supervised pre-training counterparts. Codes are available at https://github.com/enyac-group/supmae.

연구 동기 및 목표

  • 현재 마스크된 이미지 모델링에만 의존하는 마스크된 오토인코더(MAE)의 표현 학습을 감독 사전학습이 향상시킬 수 있는지 조사하는 것.
  • MAE가 전반적인 이미지 수준의 특징을 학습하는 데에 한계를 보이는 점을 해결하기 위해 사전학습 기간 동안 골드 레이블을 통합하는 것.
  • 이미지 내 공간적 부족함을 활용하여 가시 패치의 일부만 사용해 분류를 수행함으로써 학습 효율성과 특징의 강건성을 향상시키는 것.
  • 표준 감독 및 자기지도 학습 사전학습과 비교하여, 선형 탐색 및 미세조정을 포함한 다운스트림 비전 작업에서의 전이 학습 성능을 향상시키는 것.
  • 마스크된 환경에서 복원 및 분류 목표를 조합함으로써 더 샘플 효율적이고 강건한 특징 학습이 가능함을 입증하는 것.

제안 방법

  • 모든 패치나 클래스 토큰이 아닌, 가시 패치의 일부만 처리하는 병렬 감독 분류 브랜치를 MAE에 확장한다.
  • ViT 인코더를 사용해 가시 패치에서 패치 특징을 추출하며, 분류를 위해 평균 풀링을 통해 전반적인 이미지 특징을 확보한다.
  • 가시 패치 특징과 학습된 마스크 토큰을 사용해 마스크된 패치를 재구성하기 위해 소규모 디코더를 적용한다.
  • 마스크된 패치에 대한 복원 손실과 분류 헤드에 대한 크로스 엔트로피 손실을 조합하여 모델을 종합적으로 훈련한다.
  • 사전학습 기간 동안 무작위 마스킹을 적용하여 다양한 훈련 샘플을 생성하고, 강력한 정규화 효과를 얻는다.
  • 미세조정 단계에서는 복원 또는 분류 헤드를 사용하지 않고, 오직 ViT 인코더만 사용한다.

실험 결과

연구 질문

  • RQ1감독 사전학습이 마스크된 오토인코더(MAE)의 성능과 효율성을 향상시킬 수 있는가?
  • RQ2MAE에서 분류를 위해 가시 패치의 일부만 사용할 경우, 더 높은 샘플 효율성과 강건성이 달성되는가?
  • RQ3전이 학습 및 강건성 측면에서 SupMAE는 표준 감독 사전학습 및 자기지도 학습 기반 MAE와 비교해 어떻게 다른가?
  • RQ4마스크된 환경에서 복원 및 분류 목표를 조합함으로써 더 이식 가능하고 강건한 특징을 얻을 수 있는가?
  • RQ5마스크 오토인코딩 프레임워크 내에서 패치 특징에 대한 전역 평균 풀링의 영향은 무엇인가?

주요 결과

  • SupMAE는 ViT-B/16를 사용해 ImageNet-1K에서 400 에포크의 사전학습만으로도 83.6%의 정확도를 달성했으며, MAE가 요구하는 1600 에포크의 3분의 1에 불과하다.
  • SupMAE는 MAE 대비 계산 비용을 30% 줄였지만, ViT-B/16에서 ImageNet에서 동등한 성능을 달성했다.
  • 자연적 손상이 가해진 ImageNet 변종에서 SupMAE는 평균 1.8% 향상된 성능을 기록하여, 더 뛰어난 강건성을 입증했다.
  • 5-shot 설정에서 20개의 데이터셋을 대상으로 한 소수의 선형 탐색 테스트에서 SupMAE는 MAE 대비 평균 14.5%의 정확도 향상을 기록했다.
  • ADE20K 세그멘테이션에서 SupMAE는 49.0%의 mIoU를 기록했으며, 밀도 높은 예측 작업에서 뛰어난 성능을 보였다.
  • 20개의 다운스트림 분류 데이터셋에서 50-shot 미세조정 테스트에서 SupMAE는 20개 중 13개에서 최고 성능을 기록했으며, MAE와 MoCo-v3를 모두 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.