[논문 리뷰] Simple Distillation Baselines for Improving Small Self-supervised Models
이 논문은 오프라인 또는 온라인 디스티illation을 사용하여 소형 자기지도 학습 모델의 성능을 향상시키기 위한 간단한 지식 디스티illation 프레임워크인 SimDis를 제안한다. 대규모 사전 훈련된 교사 모델의 표현을 소형 학생 모델에 디스티illation함으로써 SimDis는 ResNet-18에서 선형 평가 정확도에서 기존의 SEED와 같은 방법들을 능가하는 최신 기술 수준(SOTA)의 성능을 달성한다. 메모리 백업이나 복잡한 구성 요소 없이도 가능하다.
While large self-supervised models have rivalled the performance of their supervised counterparts, small models still struggle. In this report, we explore simple baselines for improving small self-supervised models via distillation, called SimDis. Specifically, we present an offline-distillation baseline, which establishes a new state-of-the-art, and an online-distillation baseline, which achieves similar performance with minimal computational overhead. We hope these baselines will provide useful experience for relevant future research. Code is available at: https://github.com/JindongGu/SimDis/
연구 동기 및 목표
- 모델 크기가 감소할수록 심해지는 소형 자기지도 학습 모델과 그에 상응하는 지도 학습 모델 간의 성능 격차를 해소하기 위해.
- 메모리 백업이나 대비적 음성 샘플과 같은 복잡한 구성 요소에 의존하지 않고도 소형 자기지도 학습 모델을 향상시키는 실용적이고 효율적인 디스티illation 기반 설정을 개발하기 위해.
- 대규모 교사 모델에서의 디스티illation이 소형 학생 모델의 자기지도 학습 성능을 크게 향상시킬 수 있음을 입증하기 위해.
- LARS 옵timizer나 SyncBN 없이도 작동하는 최소한의 훈련 설정에서의 디스티illation 효과를 탐구하여 실용성과 계산 비용 절감을 위해.
제안 방법
- 대규모 교사 모델을 BYOL을 사용해 사전 훈련한 후, 이를 소형 학생 모델을 감독하는 데 사용하는 오프라인 디스티illation 기반 설정(SimDis-Off)을 제안한다.
- 학생과 교사 모델을 동시에 훈련시키는 온라인 디스티illation 기반 설정(SimDis-On)을 도입하며, 학생 모델은 교사 모델의 표현에서 여러 시각을 통해 학습한다.
- 교사 및 학생 모델 모두에 실리에이지 네트워크 아키텍처를 사용하며, 학생 모델은 자신의 네트워크와 교사의 네트워크에서 나온 정규화된 투영을 예측하도록 훈련된다.
- BYOL 프로토콜에 따라, 학생의 정규화된 예측과 교사의 정규화된 투영 간의 평균 제곱오차 손실을 사용한다.
- 다중 시각 디스티illation을 가능하게 하기 위해, 교사 및 학생 네트워크에서 유도된 여러 타겟 시각을 결합함으로써 최적화 안정성과 성능을 향상시킨다.
- LARS 옵timizer와 SyncBN에 대한 의존성을 제거하기 위해 단일 머신에서 8개의 GPU를 사용해 훈련함으로써, 더 단순하고 실용적인 설정에서도 강건함을 입증한다.
실험 결과
연구 질문
- RQ1대규모 사전 훈련된 교사 모델에서의 단순한 지식 디스티illation이 소형 자기지도 학습 학생 모델의 성능을 크게 향상시킬 수 있는가?
- RQ2소형 모델을 훈련할 때, 온라인 디스티illation과 오프라인 디스티illation 간의 성능 및 계산 비용은 어떻게 비교되는가?
- RQ3LARS나 SyncBN과 같은 핵심 구성 요소를 제거한 설정에서 디스티illation이 소형 자기지도 학습 모델의 성능 향상에 얼마나 기여하는가?
- RQ4학생 및 교사 네트워크에서 유도된 다중 시각 디스티illation이 학습 효율성과 최종 정확도 향상에 기여하는가?
- RQ5기존의 SEED와 같이 메모리 백업이나 음성 샘플을 사용하지 않고도 디스티illation 기반 설정이 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- SimDis-Off는 1000 에포크 후 ImageNet 선형 평가에서 ResNet-18 기준 67.18%의 top-1 정확도를 기록하며, 이는 SEED와 같은 이전 SOTA 방법들을 능가한다.
- SimDis-On은 동일한 설정에서 66.78%의 top-1 정확도를 기록하며, 온라인 디스티illation이 최소한의 계산 오버헤드로 오프라인 성능을 따라잡을 수 있음을 보여준다.
- 장기 훈련 시, 오프라인과 온라인 디스티illation 간의 성능 격차가 크게 줄어들며, 100 에포크에서는 3.65%였던 격차가 1000 에포크에선 1% 미만으로 감소한다.
- 다중 시각 디스티illation(SimDis-On-7v)은 단일 시각 대비 2.57% 향상된 성능을 기록하며, 추가적인 FLOPs가 거의 발생하지 않음에도 불구하고 오프라인 디스티illation과의 격차를 좁히는 데 기여한다.
- LARS나 SyncBN이 없는 설정에서도 SimDis-Off는 62.66%의 top-1 정확도를 기록하고, SimDis-On은 모든 7개의 시각을 사용할 경우 63.52%를 기록하여, 최소한의 실용적 훈련 조건에서도 뛰어난 성능을 보였다.
- 디스티illation 없이 학생 모델은 55.96%의 top-1 정확도를 기록하지만, 전면적인 다중 시각 디스티illation을 적용하면 63.52%로 향상되어 제안된 디스티illation 전략의 효과를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.