Skip to main content
QUICK REVIEW

[논문 리뷰] SLIP: Self-supervision meets Language-Image Pre-training

Norman Mu, Alexander M. Kirillov|arXiv (Cornell University)|2021. 12. 23.
Domain Adaptation and Few-Shot Learning인용 수 13
한 줄 요약

SLIP은 이미지 뷰에 대한 자기지도 대비 학습과 CLIP 방식의 이미지-텍스트 대비 학습을 함께 사용하는 다중 작업 학습 프레임워크를 도입한다. 이러한 목적을 결합함으로써 SLIP는 제로샷 전이, 선형 프로빙, 미세조정 벤치마크 전반에서 최신 기술 수준의 성능을 달성하며, 자기지도 학습 대비 선형 정확도를 +8.1% 향상시키고 CLIP 대비 제로샷 정확도를 +5.2% 향상시킨다.

ABSTRACT

Recent work has shown that self-supervised pre-training leads to improvements over supervised learning on challenging visual recognition tasks. CLIP, an exciting new approach to learning with language supervision, demonstrates promising performance on a wide variety of benchmarks. In this work, we explore whether self-supervised learning can aid in the use of language supervision for visual representation learning. We introduce SLIP, a multi-task learning framework for combining self-supervised learning and CLIP pre-training. After pre-training with Vision Transformers, we thoroughly evaluate representation quality and compare performance to both CLIP and self-supervised learning under three distinct settings: zero-shot transfer, linear classification, and end-to-end finetuning. Across ImageNet and a battery of additional datasets, we find that SLIP improves accuracy by a large margin. We validate our results further with experiments on different model sizes, training schedules, and pre-training datasets. Our findings show that SLIP enjoys the best of both worlds: better performance than self-supervision (+8.1% linear accuracy) and language supervision (+5.2% zero-shot accuracy).

연구 동기 및 목표

  • 자기지도 학습이 CLIP와 유사한 언어지도 시각적 표현 학습을 향상시킬 수 있는지 조사한다.
  • 자기지도 학습과 이미지-텍스트 대비 학습을 함께 최적화하는 통합된 다중 작업 프레임워크를 개발한다.
  • 다양한 최종 작업과 데이터셋에서 자기지도 학습과 언어 지도 학습 간의 상호작용을 평가한다.
  • 사전학습 데이터 규모, 모델 크기, 학습 스케줄이 표현 품질에 미치는 영향을 평가한다.
  • YFCC15M과 같은 정제되지 않은 데이터셋에서 SLIP의 효과성을 검증하며, 정제된 ImageNet에 국한되지 않는다.

제안 방법

  • SLIP는 이미지 증강 뷰에 대한 대비 자기지도 학습과 YFCC15M에서의 캡션과 함께한 이미지-텍스트 대비 학습을 함께 사용하여 Vision Transformer를 사전학습한다.
  • 모델은 이미지 증강(예: 자르기, 색상 왜곡 등)에 대한 대비 학습과 YFCC15M에서의 쌍체 이미지-텍스트 쌍에 대한 대비 학습이라는 두 가지 대비 목적을 함께 최적화한다.
  • 시각 인코더는 공통된 백본에서 이미지 뷰와 이미지-텍스트 쌍을 모두 처리하며, 각 목적에 대해 별도의 프로젝션 헤드를 사용한다.
  • 사전학습은 YFCC15M의 1,500만 개 서브셋에서 수행되며, 64개의 V100 GPU에서 데이터 증강과 혼합 정밀도 학습을 사용한다.
  • 평가 방법은 세 가지 설정으로 나뉜다: 제로샷 전이(텍스트 프롬프트 사용), 선형 분류(고정된 특징 사용), 엔드 투 엔드 미세조정.
  • 절단 실험은 두 목적을 분리하고 서로 다른 이미지 서브셋에서 학습하여 각 손실의 영향을 고립적으로 분석한다.

실험 결과

연구 질문

  • RQ1자기지도 학습과 언어 지도 학습을 결합하면 단독으로 사용할 경우보다 더 나은 시각적 표현을 얻을 수 있는가?
  • RQ2자기지도 학습이 CLIP 스타일의 언어-이미지 사전학습의 최종 작업 성능을 향상시킬 수 있는가?
  • RQ3SLIP는 제로샷, 선형 프로빙, 미세조정 등 다양한 평가 프로토콜에서 어떻게 성능을 내는가?
  • RQ4YFCC15M와 같이 정제되지 않은 대규모 데이터셋에서 사전학습을 수행하면 ImageNet 전용 사전학습보다 더 나은 일반화 성능을 얻을 수 있는가?
  • RQ5모델 크기, 학습 스케줄, 데이터 처리 방식이 SLIP의 성능에 어떤 영향을 미치는가?

주요 결과

  • ViT-L을 사용할 때 SLIP는 ImageNet에서 제로샷 정확도 47.9%를 달성하여 CLIP 대비 +5.6% 향상되고 자기지도 학습 대비 +8.1% 향상되었다.
  • 선형 프로빙에서 SLIP는 자기지도 학습 대비 +8.1% 정확도 향상을 보이며, 뛰어난 특징 품질을 입증했다.
  • SLIP는 제로샷 정확도에서 CLIP 대비 +5.2% 향상되어 자기지도 학습이 언어 유도 표현 학습을 향상시킨다는 것을 보여주었다.
  • 자기지도 학습과 텍스트 지도 학습을 분리해도 성능에 유의미한 영향을 주지 않아, 공동 최적화가 안정적이고 효과적임을 시사했다.
  • 25개 이상의 추가 최종 벤치마크에서 일관된 성능 향상을 보이며, 제로샷 및 선형 평가 설정에서 잘 일반화되었다.
  • CLIP 대비 더 느린 학습(30.5시간 대비 22.3시간)에도 불구하고, 사전학습 후 추론 오버헤드가 없으며 CC3M 및 CC12M에서도 뛰어난 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.