Skip to main content
QUICK REVIEW

[논문 리뷰] Bag of Instances Aggregation Boosts Self-supervised Distillation

Haohang Xu, Jiemin Fang|arXiv (Cornell University)|2021. 07. 04.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 교사 모델의 유사도 기반으로 관련된 인스턴스를 '백'으로 집계함으로써 소형 모델 성능을 향상시키는 자기지도 학습 정규화 방법인 BINGO를 제안한다. 이중 정규화 손실(상호 샘플 및 내부 샘플)을 적용하여 교사 모델의 관계 지식을 전이함으로써, ResNet-18과 ResNet-34를 사용할 경우 ImageNet에서 각각 65.5% 및 68.9%의 상위-1 정확도로 최신 기술(SOTA) 성능을 달성하여 이전 방법들을 크게 능가한다.

ABSTRACT

Recent advances in self-supervised learning have experienced remarkable progress, especially for contrastive learning based methods, which regard each image as well as its augmentations as an individual class and try to distinguish them from all other images. However, due to the large quantity of exemplars, this kind of pretext task intrinsically suffers from slow convergence and is hard for optimization. This is especially true for small-scale models, in which we find the performance drops dramatically comparing with its supervised counterpart. In this paper, we propose a simple but effective distillation strategy for unsupervised learning. The highlight is that the relationship among similar samples counts and can be seamlessly transferred to the student to boost the performance. Our method, termed as BINGO, which is short for Bag of InstaNces aGgregatiOn, targets at transferring the relationship learned by the teacher to the student. Here bag of instances indicates a set of similar samples constructed by the teacher and are grouped within a bag, and the goal of distillation is to aggregate compact representations over the student with respect to instances in a bag. Notably, BINGO achieves new state-of-the-art performance on small-scale models, i.e., 65.5% and 68.9% top-1 accuracies with linear evaluation on ImageNet, using ResNet-18 and ResNet-34 as the backbones respectively, surpassing baselines (52.5% and 57.4% top-1 accuracies) by a significant margin. The code is available at https://github.com/haohang96/bingo.

연구 동기 및 목표

  • 대규모 예시 집합으로 인해 소형 모델에서 대비 자기지도 학습의 수렴 속도가 느리고 최적화가 열악한 문제를 해결하기 위해.
  • 무 supervisory 신호가 존재하는 무 supervision 학습에서, 무작위 인스턴스 쌍 대신 매우 유사한 샘플 간의 관계적 구조를 활용하여 지식 정규화를 향상시키기 위해.
  • 대규모 교사 모델에서 소형 학생 모델로 압축된 백 기반 표현을 전이하는 관계 지도 정규화 전략을 개발하기 위해.
  • 라벨이 없는 데이터를 요구하지 않고도 소규모 모델을 위한 자기지도 표현 학습에서 최신 기술 성능을 달성하기 위해.

제안 방법

  • 사전 훈련된 교사 모델의 임bedding을 기반으로 유사도를 기반으로 높은 유사도를 가진 인스턴스들을 '백'으로 구성한다. 주어진 앵커 인스턴스와 높은 유사도를 가진 인스턴스들을 한 백으로 묶는다.
  • 백 기반 데이터셋이 표준 인스턴스 기반 데이터셋을 대체함으로써, 관련된 샘플의 구조적 그룹에 대해 정규화를 수행할 수 있도록 한다.
  • 이중 정규화 손실을 도입한다: 내부 샘플 손실은 동일한 이미지의 증강된 버전이 학생 및 교사 네트워크에서 일치하도록 하고, 상호 샘플 손실은 백 내의 모든 인스턴스를 앵커에 가까이 끌어당긴다.
  • 백 구성은 교사 모델의 임베딩 공간에서의 유사도 점수를 사용하여, 오직 매우 관련성이 높은 샘플들만 그룹화되도록 보장한다.
  • 학생 모델은 인스턴스 수준과 백 수준의 지도 정보를 모두 통합한 수정된 대비 목적함수를 사용하여 훈련된다.
  • 이 방법은 기존 자기지도 학습 프레임워크와 호환되며, 아키텍처 변경을 최소한으로 적용할 수 있다.

실험 결과

연구 질문

  • RQ1매우 유사한 샘플들을 '백'으로 집계하는 것이 소형 모델의 자기지도 학습에서 지식 정규화를 향상시키는가?
  • RQ2유사한 샘플 간의 관계 지식을 전이하면 관계에 무관한 정규화 방법보다 더 나은 표현 학습을 이끌 수 있는가?
  • RQ3교사 모델의 가중치 없이 교사의 데이터 관계만을 사용할 경우 학생 모델의 성능는 어떻게 되는가? 교사의 가중치와 관계 정보를 모두 사용할 경우와 비교해보면?
  • RQ4BINGO는 ResNet-18 및 ResNet-34와 같은 소형 백본을 사용할 때 선형 평가 하에서 ImageNet에서 최신 기술 성능을 달성할 수 있는가?
  • RQ5동일한 훈련 에포크 수(100 에포크)에서 BINGO의 계산 비용은 SEED 및 DisCo와 같은 기존 방법들과 비교해 어떻게 되는가?

주요 결과

  • BINGO는 학생 모델로 ResNet-18을 사용할 경우 ImageNet에서 65.5%의 최신 기술 상위-1 정확도를 달성하여 이전 최신 기술인 52.5%를 초월한다.
  • 학생 모델로 ResNet-34를 사용할 경우 BINGO는 68.9%의 상위-1 정확도를 기록하며, 이는 이전 최신 기술인 57.4%를 크게 뛰어넘는 성능이다.
  • 교사 모델의 사전 훈련된 가중치 없이 교사의 데이터 관계만을 사용할 경우에도 BINGO는 여전히 62.2%의 정확도를 달성하여, 관계 지식 자체의 가치를 입증한다.
  • 동일한 훈련 비용(100 에포크)에서도 BINGO는 SEED(62.7% 상위-1)를 능가하고, 200 에포크에서 DisCo(68.1% 상위-1)와 동등한 성능을 기록함으로써 더 뛰어난 샘플 효율성을 보여준다.
  • 제거 실험을 통해 교사의 사전 훈련된 가중치와 관계 정보를 함께 사용할 경우가 가장 우수한 성능(ResNet-18 기준 64.0%)을 기록함을 확인하여, 두 요소가 상호 보완적인 이점을 가짐을 입증한다.
  • BINGO의 계산 비용은 DisCo와 유사하며, 훈련 시간이 제한된 환경에서도 강력한 성능 유지를 보이며, 더 긴 훈련 스케줄을 가진 방법들보다 뛰어난 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.