Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Self-Supervised Learning: Small is Beautiful

Yun-Hao Cao, Jianxin Wu|arXiv (Cornell University)|2021. 03. 25.
Domain Adaptation and Few-Shot Learning참고 문헌 37인용 수 10
한 줄 요약

이 논문은 해상도, 아키텍처, 데이터 크기를 작게 사용하는 방식으로 기존 자기지도 학습(Self-supervised Learning, SSL)의 패러다임을 전복하는 Scaled-down Self-supervised Learning(S3L)을 제안한다. 제한된 데이터로 복잡도가 낮고 입력 해상도가 낮은 모델을 훈련시킴으로써, S3L는 표준 SSL 방법보다 훨씬 낮은 계산 비용으로도 더 높은 정확도를 달성하며, CUB200 및 Cars와 같은 소규모 데이터셋에서 ImageNet 사전학습 모델을 능가하는 성능을 보인다.

ABSTRACT

Self-supervised learning (SSL), in particular contrastive learning, has made great progress in recent years. However, a common theme in these methods is that they inherit the learning paradigm from the supervised deep learning scenario. Current SSL methods are often pretrained for many epochs on large-scale datasets using high resolution images, which brings heavy computational cost and lacks flexibility. In this paper, we demonstrate that the learning paradigm for SSL should be different from supervised learning and the information encoded by the contrastive loss is expected to be much less than that encoded in the labels in supervised learning via the cross entropy loss. Hence, we propose scaled-down self-supervised learning (S3L), which include 3 parts: small resolution, small architecture and small data. On a diverse set of datasets, SSL methods and backbone architectures, S3L achieves higher accuracy consistently with much less training cost when compared to previous SSL learning paradigm. Furthermore, we show that even without a large pretraining dataset, S3L can achieve impressive results on small data alone. Our code has been made publically available at https://github.com/CupidJay/Scaled-down-self-supervised-learning.

연구 동기 및 목표

  • 자기지도 학습(SSL)이 감독 학습의 대규모, 고해상도, 장기 훈련 패러다임을 모방해야 한다는 가정을 도전하기 위해.
  • 입력 해상도, 모델 크기, 사전학습 데이터를 줄여도 SSL의 효율성과 성능이 향상될 수 있는지 탐구하기 위해.
  • 대규모 사전학습 없이 소규모 최종 데이터셋에서 직접 SSL을 훈련하는 것이 더 우수한 결과를 낼 수 있음을 보여주기 위해.
  • 제한된 데이터에서 SSL 성능에 영향을 주는 특정 네트워크 구성 요소(예: 마지막 잔차 블록)의 역할을 탐색하기 위해.
  • 특히 장기 훈련을 통해 데이터가 적을 때 SSL이 감독 학습보다 더 강건하다는 것을 입증하기 위해.

제안 방법

  • 소규모 입력 해상도(예: 224×224 대신 112×112), 더 작은 백본 아키텍처(예: 마지막 잔차 블록 제거), 그리고 소규모 최종 데이터셋에서 직접 사전학습하는 방식을 사용하는 새로운 SSL 패러다임인 S3L를 제안한다.
  • 표준 대비 학습 기반의 InfoNCE 손실을 사용하지만, 계산 비용을 줄이고 소규모 데이터에서의 일반화 성능을 향상시키기 위해 축소된 설정에서 적용한다.
  • 성능 향상을 위해 과적합을 줄이기 위해 도입한 두 가지 핵심 아키텍처 수정 사항: 'conv5 가중치 제거'와 'conv5 제거'로, 모두 소규모 데이터셋에서 성능 향상을 입증했다.
  • SimCLR 프레임워크를 사용해 소규모 데이터셋에서 800~1600 에포크 동안 모델을 사전학습한 후, 표준 학습률 스케줄링을 사용해 미세조정한다.
  • 표준 SSL(SimCLR, MoCov2 등) 및 ImageNet에서의 감독 학습 사전학습과 비교하여, CUB200, pets, flowers 포함 7개의 소규모 벤치마크에서 평가한다.
  • 소규모 ImageNet 하위집합(10,000장 및 50,000장 이미지)에서의 성능을 평가하여, SSL이 데이터 부족에 얼마나 강건한지 평가한다.

실험 결과

연구 질문

  • RQ1입력 해상도와 모델 크기를 줄이면 소규모 데이터셋에서 자기지도 표현 학습 성능이 향상될 수 있는가?
  • RQ2대규모 사전학습 없이 소규모 최종 데이터셋에서 직접 사전학습을 수행하면 표준 SSL 패러다임보다 더 좋은 결과를 낼 수 있는가?
  • RQ3데이터가 제한되었을 때 마지막 잔차 블록을 제거하는 것 같은 아키텍처 수정 사항이 SSL 성능에 어떤 영향을 미치는가?
  • RQ4소규모 데이터셋에서 훈련할 경우, SSL이 감독 학습보다 일반화 성능와 과적합에 대해 어떻게 더 우수한가?
  • RQ5S3L는 ImageNet 사전학습 없이도 소규모 데이터셋에서 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • S3L는 'conv5 제거' 전략을 사용할 경우 CUB200, pets, flowers에서 각각 17.3%, 32.7%, 25.5%의 상대 정확도 향상을 달성한다.
  • CUB200에서 S3L는 사전학습 없이 훈련을 시작해도 최신 기술 성능을 달성하며, ImageNet에서 사전학습된 모델보다 뛰어난 성능을 보인다.
  • 소규모 ImageNet(10,000장 이미지)에서 MoCov2는 112×112 해상도로 강력한 다운스트림 검출 성능를 보였지만, 감독 학습은 과적합으로 실패했다.
  • 장기 사전학습(최대 1600 에포크)은 소규모 데이터에서 SSL 성능을 향상시키지만, 감독 학습에는 악영향을 주며, 이는 SSL이 더 높은 데이터 효율성을 가짐을 시사한다.
  • 'conv5 제거' 전략은 'conv5 가중치 제거'보다 더 낮은 훈련 비용으로 성능이 뛰어나, 소규모 데이터에서 최종 레이어가 대비 손실에 과적합되기 쉬운 경향이 있음을 시사한다.
  • S3L는 ImageNet 사전학습 없이도 CUB200, Cars, Aircraft, pets에서 최신 기술 성능을 달성하여, 직접적인 소규모 데이터 SSL의 가능성과 타당성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.