Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Masking for Self-Supervised Learning

Yuge Shi, N. Siddharth|arXiv (Cornell University)|2022. 01. 31.
Domain Adaptation and Few-Shot Learning인용 수 14
한 줄 요약

ADIOS는 원본 이미지와 가림된 이미지 간의 표현 거리 최소화를 위해 암시적 목적을 통해 마스크 함수와 이미지 인코더를 동시에 훈련하는 새로운 비지도 학습 프레임워크를 제안한다. 이때 인코더는 원본 이미지와 가림된 이미지 간의 표현 거리를 최소화하도록 학습하고, 마스크 함수는 이를 최대화하도록 학습한다. 이 방법은 의미적으로 유의미한 마스크를 생성하며, ImageNet100, CIFAR, iNaturalist 등 다양한 벤치마크에서 최신 SOTA 비지도 학습 방법보다 일관되게 성능 향상을 이룬다. 또한, 비전 트랜스포머나 이미지 디코더를 요구하지 않으며, 합성곱 기반 백본과도 호환된다.

ABSTRACT

We propose ADIOS, a masked image model (MIM) framework for self-supervised learning, which simultaneously learns a masking function and an image encoder using an adversarial objective. The image encoder is trained to minimise the distance between representations of the original and that of a masked image. The masking function, conversely, aims at maximising this distance. ADIOS consistently improves on state-of-the-art self-supervised learning (SSL) methods on a variety of tasks and datasets -- including classification on ImageNet100 and STL10, transfer learning on CIFAR10/100, Flowers102 and iNaturalist, as well as robustness evaluated on the backgrounds challenge (Xiao et al., 2021) -- while generating semantically meaningful masks. Unlike modern MIM models such as MAE, BEiT and iBOT, ADIOS does not rely on the image-patch tokenisation construction of Vision Transformers, and can be implemented with convolutional backbones. We further demonstrate that the masks learned by ADIOS are more effective in improving representation learning of SSL methods than masking schemes used in popular MIM models. Code is available at https://github.com/YugeTen/adios.

연구 동기 및 목표

  • 마스크 이미지 모델링(MIM)에서 국소적 픽셀 상관관계에 의존하는 랜덤 또는 패치 기반 마스킹의 한계를 해결하기 위해.
  • 전체 의미적 엔티티를 가리키는 마스크를 학습하여 비지도 표현 학습을 향상시키기 위해.
  • ViT와 합성곱 기반 백본 모두와 호환되는 프레임워크를 개발하여 패치 기반 토큰화에 의존하지 않기 위해.
  • 의미적으로 유의미한 마스크가 무작위 또는 고정된 형태의 마스크보다 상당히 뛰어난 성능 향상을 이끌어내는지 확인하기 위해.
  • 마스크 함수의 적대적 훈련이 표현 학습을 위한 보다 효과적인 증강 기법이 되는지 확인하기 위해.

제안 방법

  • ADIOS는 두 구성 요소인 추론 모델(인코더)과 가림 모델(마스크 생성기)을 갖는 시아미즈 스타일의 적대적 프레임워크를 사용한다.
  • 가림 모델은 U-넷 기반 아키텍처를 사용하여 [0,1] 범위의 값으로 이미지 크기의 마스크를 생성하며, 1은 가려진 영역을 나타낸다.
  • 추론 모델은 원본 이미지와 가려진 이미지의 표현 간의 대비 손실을 최소화하도록 훈련된다.
  • 가림 모델은 동일한 대비 손실을 최대화하도록 적대적으로 훈련되어, 인코더가 원본과 가려진 입력을 구분하기 어려워지도록 한다.
  • 공간적 일관성과 의미적 일관성을 향상시키기 위해 마스크는 완전 연결 조건부 랜덤 필드(CRF)를 사용해 개선된다.
  • 이 프레임워크는 디코더나 시각적 토크나이저가 필요 없는 인코더 전용 모델로 구현되어, 합성곱 기반 백본과의 호환성을 보장한다.

실험 결과

연구 질문

  • RQ1의미적으로 유의미한 마스크를 생성하는 적대적으로 훈련된 마스킹 함수는 랜덤 또는 고정된 형태의 마스킹보다 비지도 표현 학습 성능을 향상시키는가?
  • RQ2의미적 마스킹의 성능 향상 효과가 ImageNet100, CIFAR, iNaturalist 등 다양한 데이터셋과 후속 작업에서 유지되는가?
  • RQ3ADIOS는 비전 트랜스포머에 의존하지 않고도 합성곱 신경망 백본과 효과적으로 적용될 수 있는가?
  • RQ4학습된 마스크의 품질은 표현 학습 성능 측면에서 참값 객체 마스크와 얼마나 유사한가?
  • RQ5비지도 학습에서 적대적 마스킹 목적 함수는 생성 재구성 목적 함수보다 기능적으로 뛰어나다고 할 수 있는가?

주요 결과

  • ADIOS는 ImageNet100 분류에서 기존의 MIM 방법들인 MAE와 BEiT를 능가하는 최신 SOTA 성능을 달성한다.
  • CIFAR-10과 CIFAR-100에서 ADIOS는 기준 MIM 방법 대비 선형 프로브 정확도를 최대 2.5% 향상시킨다.
  • iNaturalist 및 Flowers102에서의 전이 학습 결과, iNaturalist-2021에서 3% 이상의 개선을 보였다.
  • ADIOS가 생성한 마스크는 의미적으로 유의미하며, 표현 학습 향상 측면에서 참값 객체 마스크와 거의 동일한 효과를 보였다.
  • 제거 분석 결과, 의미적 마스크가 랜덤 또는 고정된 형태의 마스크보다 상당히 뛰어난 성능을 보이며, MIM에서 마스크 설계의 중요성을 입증했다.
  • ADIOS는 대비 및 비대비 방법을 포함한 다양한 비지도 학습 목적 함수에서 성능 향상을 보이며, 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.