Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Image Modeling with Denoising Contrast

Kun Yi, Yixiao Ge|arXiv (Cornell University)|2022. 05. 19.
Image and Signal Denoising Methods인용 수 8
한 줄 요약

이 논문은 전통적인 이미지 토크나이저를 제거하고 복원 대비 학습을 통합하여 순수한 마스킹된 이미지 모델링(MIM) 방법인 ConMIM을 제안한다. 이는 유일한 목표로 내부 이미지 간 패치 간 대비 손실을 사용한다. 비대칭 이미지 변형과 모델 진행률을 도입함으로써 ConMIM은 추가 데이터나 사전 훈련 단계 없이도 최신 기술 수준의 성능을 달성한다. ImageNet-1K에서 ViT-Small로는 83.9%의 top-1 정확도, ViT-Base로는 85.3%를 기록한다.

ABSTRACT

Since the development of self-supervised visual representation learning from contrastive learning to masked image modeling (MIM), there is no significant difference in essence, that is, how to design proper pretext tasks for vision dictionary look-up. MIM recently dominates this line of research with state-of-the-art performance on vision Transformers (ViTs), where the core is to enhance the patch-level visual context capturing of the network via denoising auto-encoding mechanism. Rather than tailoring image tokenizers with extra training stages as in previous works, we unleash the great potential of contrastive learning on denoising auto-encoding and introduce a pure MIM method, ConMIM, to produce simple intra-image inter-patch contrastive constraints as the sole learning objectives for masked patch prediction. We further strengthen the denoising mechanism with asymmetric designs, including image perturbations and model progress rates, to improve the network pre-training. ConMIM-pretrained models with various scales achieve competitive results on downstream image classification, semantic segmentation, object detection, and instance segmentation tasks, e.g., on ImageNet-1K classification, we achieve 83.9% top-1 accuracy with ViT-Small and 85.3% with ViT-Base without extra data for pre-training.

연구 동기 및 목표

  • 마스킹된 이미지 모델링에서 별도의 이미지 토크나이저가 필요 없도록, 대비 학습을 사전 훈련 목표에 직접 통합하는 것.
  • 비대칭 훈련 설계를 통해 비전 트랜스포머의 복원 자동에코딩 능력을 향상시키는 것.
  • 적절히 재구상된 대비 학습이 이산 토크나이징 없이도 기존의 MIM 방법을 능가할 수 있음을 보여주는 것.
  • 소규모 비전 트랜스포머와 YFCC15M와 같은 대규모 비구조화된 데이터셋에서 ConMIM의 효과를 검증하는 것.
  • 최근 MIM의 우세함을 고려할 때, 대비 학습이 자기지도 학습 시각 표현 학습에서 수행하는 역할을 재평가하는 것.

제안 방법

  • ConMIM는 마스킹된 패치 예측을 복원 대비 학습 작업으로 간주하며, 전체 입력 이미지를 사용해 동적 키를 생성하여 대비 손실을 계산한다.
  • 단일 뷰, 두 번의 순방향 전파를 사용한다: 하나는 마스킹된 입력(패치가 제거된)이고, 다른 하나는 전체 입력을 통해 양성 키를 생성한다.
  • 양성 키는 전체 입력에서 동일한 공간 위치의 패치 표현이며, 음성 키는 동일한 이미지 내 다른 공간 위치의 패치 표현이다.
  • 비대칭 이미지 변형을 적용한다: 전체 입력에는 강한 증강을, 손상된 입력에는 약한 증강을 적용하여 강건성을 향상시킨다.
  • 비대칭 모델 진행률을 사용한다: 전체 입력을 처리하는 느리게 업데이트되는 모멘터리 엔코더가 안정적이고 의미적으로 일관된 키 표현을 생성한다.
  • 대비 손실은 마스킹된 패치의 예측 표현과 해당 양성 키 사이에서 계산되며, 세밀한 시각적 맥락 학습을 장려한다.

실험 결과

연구 질문

  • RQ1이산 이미지 토크나이저 없이 순수한 마스킹된 이미지 모델링 프레임워크 내에서 대비 학습을 효과적으로 재활용할 수 있는가?
  • RQ2비대칭 이미지 변형과 모델 진행률은 MIM 사전 훈련의 성능과 일반화에 어떤 영향을 미치는가?
  • RQ3ConMIM은 MAE나 iBOT과 같은 기존의 MIM 방법을 능가하는가, 특히 소규모 비전 트랜스포머에서 성능이 뛰어나게 되는가?
  • RQ4ConMIM는 추가적인 감독 없이도 YFCC15M와 같은 대규모 비구조화된 데이터셋으로 효과적으로 확장 가능한가?
  • RQ5MIM에서 대비 학습과 자동에코딩의 상대적 기여도는 무엇이며, 어떻게 최적의 조합을 이룰 수 있는가?

주요 결과

  • ConMIM는 추가 데이터나 토크나이저 없이 ViT-Small와 ImageNet-1K 데이터만을 사용해 ImageNet-1K에서 83.9%의 top-1 정확도를 달성했으며, BEiT 및 기타 MIM 방법을 능가한다.
  • ViT-Base를 사용할 경우 ConMIM는 ImageNet-1K에서 85.3%의 top-1 정확도를 기록하여 더 큰 아키텍처에서 강력한 성능을 보였다.
  • 제거 실험 결과, 비대칭 모델 진행률을 제거하면 정확도가 1.98% 감소함을 확인했으며, 이는 정보 泄露 방지를 위한 핵심 기여를 한다는 것을 시사한다.
  • 비대칭 이미지 변형은 성능 향상에 기여한다: 전체 입력에 강한 증강, 손상된 입력에 약한 증강을 적용할 경우 대칭 또는 반대 설정보다 더 좋은 성능을 기록한다.
  • YFCC15M에서 ConMIM는 ViT-B/16를 사용해 83.3%의 top-1 정확도를 달성했으며, SLIP(82.9%)와 MAE(83.0%)를 모두 앞서며 대규모 데이터에 대한 확장성을 확인한다.
  • ConMIM의 에포크당 훈련 시간은 BEiT(1.0×)의 1.05배이며, 두 번의 순방향 전파로 인한 미미한 오버헤드 외에는 효율적이고 실용적인 실전 적용이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.