Skip to main content
QUICK REVIEW

[논문 리뷰] VanillaKD: Revisit the Power of Vanilla Knowledge Distillation from Small Scale to Large Scale

Zhiwei Hao, Jianyuan Guo|arXiv (Cornell University)|2023. 05. 25.
COVID-19 diagnosis using AI인용 수 5
한 줄 요약

이 논문은 바닐라 지식 정복(KD)을 재검토하며, 이전의 가정과는 반대로, 아키텍처 수정 없이도 이미지넷-1K과 같은 대규모 데이터셋에서 최신 기술 성능을 달성할 수 있음을 보여준다. 강력한 데이터 증강과 더 긴 학습 스케줄을 활용함으로써, 바닐라 KD는 복잡한 KD 변종들을 능가하며, ResNet-50에서는 83.1%의 top-1 정확도, ViT-S에서는 84.3%, ConvNeXtV2-T에서는 85.0%를 기록한다.

ABSTRACT

The tremendous success of large models trained on extensive datasets demonstrates that scale is a key ingredient in achieving superior results. Therefore, the reflection on the rationality of designing knowledge distillation (KD) approaches for limited-capacity architectures solely based on small-scale datasets is now deemed imperative. In this paper, we identify the \emph{small data pitfall} that presents in previous KD methods, which results in the underestimation of the power of vanilla KD framework on large-scale datasets such as ImageNet-1K. Specifically, we show that employing stronger data augmentation techniques and using larger datasets can directly decrease the gap between vanilla KD and other meticulously designed KD variants. This highlights the necessity of designing and evaluating KD approaches in the context of practical scenarios, casting off the limitations of small-scale datasets. Our investigation of the vanilla KD and its variants in more complex schemes, including stronger training strategies and different model capacities, demonstrates that vanilla KD is elegantly simple but astonishingly effective in large-scale scenarios. Without bells and whistles, we obtain state-of-the-art ResNet-50, ViT-S, and ConvNeXtV2-T models for ImageNet, which achieve 83.1\%, 84.3\%, and 85.0\% top-1 accuracy, respectively. PyTorch code and checkpoints can be found at https://github.com/Hao840/vanillaKD.

연구 동기 및 목표

  • 대규모 설정에서 바닐라 KD를 재평가함으로써, 기존의 복잡한 KD 방법이 높은 성능을 내기 위해 필수적이라는 일반적인 가정을 도전한다.
  • 기존 KD 문헌에서의 '작은 데이터 오류'를 규명한다. 즉, CIFAR-100과 같은 소규모 벤치마크에서는 바닐라 KD의 능력을 과소평가한다.
  • 학습 전략과 모델 용량이 스케일에 따라 KD 성능에 어떻게 영향을 미치는지, 특히 이미지넷-1K에서 분석한다.
  • 강력한 데이터 증강과 더 긴 학습 스케줄을 적용할 경우, 추가 구성 요소 없이도 바닐라 KD가 현대적인 백본 아키텍처에서 최신 기술 성능을 달성할 수 있음을 입증한다.
  • 소규모 벤치마크에 의존하기보다는, 실제 대규모 시나리오에서 KD 방법을 평가할 것을 주장한다.

제안 방법

  • 강력한 데이터 증강과 연장된 학습 스케줄을 사용하여 이미지넷-1K에서 바닐라 KD를 재평가함으로써, 복잡한 KD 변종들과의 성능 비교를 수행한다.
  • 학습된 출력 확률(로그릿) 기반 KD(예: 힌트의 원래 KD)와 힌트 기반 방법(예: FitNet, CRD)을 다양한 모델 용량과 학습 레시피에서 비교한다.
  • 표준 지식 정복 손실을 사용한다: 온도 스케일링을 적용한 교차 엔트로피 손실로, 교사의 소프트 레이블과 학생의 예측을 비교한다.
  • 모든 방법에서 동일한 학습 레시피를 사용하여 학생 모델(ResNet-50, ViT-S, ConvNeXtV2-T)을 훈련시켜 공정한 비교를 확보한다.
  • 모든 실험에 동일한 일관된 학습 프로토콜을 적용한다: 연장된 학습, 강력한 증강 기법(예: Mixup, CutMix), 표준 최적화 설정.
  • 다양한 모델 아키텍처와 교사-학생 용량 조합을 통해 결과를 검증함으로써, 발견의 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1이미지넷-1K와 같은 대규모 데이터셋에서 평가할 경우, 바닐라 KD와 고급 KD 방법 간의 성능 격차가 여전히 유지되는가?
  • RQ2더 강력한 데이터 증강과 더 긴 학습 스케줄은 바닐라 KD 성능을 복잡한 KD 변종들보다 얼마나 향상시키는가?
  • RQ3모델 용량(예: Res34가 Res50를 지도하는 경우)이 바닐라 KD의 효과성에 어떤 영향을 미치는가?
  • RQ4왜 힌트 기반 KD 방법은 대규모 설정에서 로짓 기반 방법보다 성능이 열 劣하는가?
  • RQ5강력한 데이터 증강과 더 긴 학습 스케줄을 적용할 경우, 추가 구성 요소 없이도 바닐라 KD가 현대적인 비전 백본 아키텍처에서 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • 바닐라 KD는 ResNet-50에서 83.1%의 top-1 정확도를 기록하며 이미지넷-1K에서 최신 기술 성능을 달성한다. 이는 이전 최고 기록을 초월한다.
  • ViT-S에서는 바닐라 KD가 84.3%의 top-1 정확도를 기록하며, 추가 구성 요소 없이도 새로운 최고 기록을 수립한다.
  • ConvNeXtV2-T에서는 바닐라 KD가 85.0%의 top-1 정확도를 기록하며, 이전에 보고된 결과를 능가한다.
  • 강력한 데이터 증강과 더 긴 학습 스케줄을 적용할 경우, 바닐라 KD와 복잡한 KD 변종 간의 성능 격차가 크게 줄어든다.
  • 대규모 벤치마크에서 로짓 기반 KD 방법은 일관되게 힌트 기반 방법보다 일반화 능력에서 뛰어나다.
  • 강력한 학습 전략을 적용할 경우, 모델 용량이 정복 효과성에 미치는 영향은 미미하며, 이는 바닐라 KD가 아키텍처 스케일 전반에서 강건함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.