Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Learning by Estimating Twin Class Distributions

Feng Wang, Tao Kong|arXiv (Cornell University)|2021. 10. 14.
Domain Adaptation and Few-Shot Learning참고 문헌 58인용 수 6
한 줄 요약

Twist는 자기지도 학습 표현 학습 방법을 제안하며, 증강된 시각에서 쌍둥이 클래스 분포를 추정하고 상호정보 최대화를 통해 붕괴된 해법을 방지함으로써 레이블이 없는 이미지를 분류한다. 이는 최신 기술 수준의 성능을 달성하며, 레이블이 1%뿐인 ImageNet에서 61.2%의 top-1 정확도를 기록하여 이전 방법보다 6.2个百分点 높게 기록한다. 특히 준지도 학습에서 뛰어난 성능을 보였다.

ABSTRACT

We present TWIST, a simple and theoretically explainable self-supervised representation learning method by classifying large-scale unlabeled datasets in an end-to-end way. We employ a siamese network terminated by a softmax operation to produce twin class distributions of two augmented images. Without supervision, we enforce the class distributions of different augmentations to be consistent. However, simply minimizing the divergence between augmentations will cause collapsed solutions, i.e., outputting the same class probability distribution for all images. In this case, no information about the input image is left. To solve this problem, we propose to maximize the mutual information between the input and the class predictions. Specifically, we minimize the entropy of the distribution for each sample to make the class prediction for each sample assertive and maximize the entropy of the mean distribution to make the predictions of different samples diverse. In this way, TWIST can naturally avoid the collapsed solutions without specific designs such as asymmetric network, stop-gradient operation, or momentum encoder. As a result, TWIST outperforms state-of-the-art methods on a wide range of tasks. Especially, TWIST performs surprisingly well on semi-supervised learning, achieving 61.2% top-1 accuracy with 1% ImageNet labels using a ResNet-50 as backbone, surpassing previous best results by an absolute improvement of 6.2%. Codes and pre-trained models are given on: https://github.com/bytedance/TWIST

연구 동기 및 목표

  • 복잡한 아키텍처나 클러스터링에 의존하지 않고도 붕괴된 해법을 피할 수 있는 단순하고 이론적으로 타당한 자기지도 학습 방법을 개발한다.
  • 소프트맥스 출력을 갖는 시아미즈 네트워크를 사용하여 대규모 레이블이 없는 데이터셋을 분류함으로써 엔드 투 엔드 표현 학습을 가능하게 한다.
  • 부정 샘플, 모멘터리 엔코더, 정지 기울기 연산과 같은 명시적 지도 신호가 필요 없도록 한다.
  • 입력 이미지와 예측 간의 상호정보를 최대화하여 준지도 학습 성능을 향상시킨다.
  • 예측의 날카기성과 다양성을 균형 잡는 통합적이고 설명 가능한 손실 함수를 제공한다.

제안 방법

  • Twist는 동일한 이미지의 두 개의 증강된 시각에서 공유 가중치를 갖는 시아미즈 네트워크를 사용하여 쌍둥이 클래스 분포를 생성한다.
  • 입력 시각 간의 일관성을 확보하기 위해 교차 엔트로피 손실을 사용하여 두 분포 간의 발산을 최소화한다.
  • 붕괴된 해법을 방지하기 위해 두 가지 목표를 통해 입력 이미지와 예측 간의 상호정보를 최대화한다: 각 샘플의 엔트로피를 최소화함으로써 날카기성 확보, 평균 분포 엔트로피를 최대화함으로써 다양성 확보.
  • 결합된 목표는 날카기성과 다양성을 동시에 최적화하는 통합 손실 함수인 Twist 손실을 형성한다.
  • 학습 안정성과 열 붕괴 방지를 위해 소프트맥스 전에 배치 정규화를 사용하지만, 이는 단독으로는 충분하지 않다.
  • 클러스터링, 모멘터리 엔코더, 비대칭 아키텍처가 필요 없어 간단하고 모듈러하다.

실험 결과

연구 질문

  • RQ1입력 이미지와 클래스 예측 간의 상호정보 최대화가 자기지도 분류에서 붕괴된 해법을 방지할 수 있는가?
  • RQ2날카기성과 다양성에 기반한 통합 손실 함수가 부정 샘플이나 모멘터리 엔코더에 의존하는 방법보다 우월한가?
  • RQ3레이블이 소수만 존재할 경우 Twist는 준지도 학습에서 어떤 성능을 보이는가?
  • RQ4배치 정규화와 다중 크롭 데이터 증강과 같은 아키텍처 구성 요소가 성능에 어떤 영향을 미치는가?
  • RQ5아키텍처 수정 없이 다양한 후속 작업에 대해 Twist는 일반화 가능한가?

주요 결과

  • Twist는 ResNet-50를 사용하여 레이블이 1%뿐인 ImageNet에서 61.2%의 top-1 정확도를 기록했으며, 이는 이전 최고 성능 방법보다 6.2个百分点 높은 성능이다.
  • 완전히 자기지도 사전 학습에서 ImageNet에서 40.6%의 top-1 정확도를 달성하여 레이블 없이도 강력한 표현 학습 능력을 입증했다.
  • 제거 실험 결과 날카기성과 다양성 항목 모두 필수적임을 확인했다: 다양성 항목을 제거하면 성능 저하가 발생하고, 날카기성 항목을 제거하면 기울기 붕괴가 발생한다.
  • 다중 크롭 데이터 증강과 자기 레이블링이 함께 성능 향상에 기여하며, 둘 다 사용할 경우 최고의 성능를 기록한다.
  • 클래스 수 변화에 대해 강건하며, 다중 크롭을 사용할 경우 4096개 클래스에서 최적의 성능를 기록한다.
  • 다중 크롭 없이 더 긴 에포크로 학습하면 성능 향상이 이루어지지만, 다중 크롭을 사용할 경우 400 에포크를 초과하면 성능 향상이 정체된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.