Skip to main content
QUICK REVIEW

[논문 리뷰] NormKD: Normalized Logits for Knowledge Distillation

Zhihao Chi, Zhengkai Tu|arXiv (Cornell University)|2023. 08. 01.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 각 샘플의 로짓 분포의 표준편차를 기반으로 온전히 맞춤형 온도를 설정함으로써 더 균형 잡힌 소프트 레이블 생성을 가능하게 하는 단순하면서도 효과적인 지식 증류 방법인 NormKD를 제안한다. 로짓을 소프트닝하기 전에 각 샘플별로 정규화함으로써 NormKD는 일반적인 KD보다 성능을 크게 향상시키며, 일부 특징 기반 방법을 뛰어넘는 성능을 기록한다. 이는 거의 추가적인 계산 비용 없이 달성된다.

ABSTRACT

Logit based knowledge distillation gets less attention in recent years since feature based methods perform better in most cases. Nevertheless, we find it still has untapped potential when we re-investigate the temperature, which is a crucial hyper-parameter to soften the logit outputs. For most of the previous works, it was set as a fixed value for the entire distillation procedure. However, as the logits from different samples are distributed quite variously, it is not feasible to soften all of them to an equal degree by just a single temperature, which may make the previous work transfer the knowledge of each sample inadequately. In this paper, we restudy the hyper-parameter temperature and figure out its incapability to distill the knowledge from each sample sufficiently when it is a single value. To address this issue, we propose Normalized Knowledge Distillation (NormKD), with the purpose of customizing the temperature for each sample according to the characteristic of the sample's logit distribution. Compared to the vanilla KD, NormKD barely has extra computation or storage cost but performs significantly better on CIRAR-100 and ImageNet for image classification. Furthermore, NormKD can be easily applied to the other logit based methods and achieve better performance which can be closer to or even better than the feature based method.

연구 동기 및 목표

  • 예측 신뢰도 분포가 다양할 경우 고정된 온도 설정이 로짓을 충분히 부드럽게 다루지 못하는 지식 증류의 한계를 해결하기 위해.
  • 각 샘플의 로짓 분포 특성에 따라 온도를 동적으로 조정하여 지식 전이를 향상시키기 위해.
  • 추가적인 계산 비용이나 저장 비용을 크게 증가시키지 않으면서도 로짓 기반 증류를 향상시키는 방법을 개발하기 위해.
  • 적절히 최적화된 로짓 기반 증류가 특징 기반 방법과 비교해도 성능이 유사하거나 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 각 샘플에 대해 NormKD는 교사 모델의 로짓의 표준편차를 계산하고 이를 로짓을 소프트닝하는 데 사용하는 온도로 활용한다.
  • 표준 온도를 사용하는 소프트맥스 적용 전에 로짓을 평균을 빼고 표준편차로 나누어 각 샘플별로 정규화한다.
  • 이 정규화 과정을 통해 모든 샘플이 유사한 로짓 분포를 가지게 되어 더 일관되고 효과적인 지식 전이가 가능해진다.
  • 이 방법은 어떤 로짓 기반 증류 프레임워크와도 호환되며, DKD와 같은 기존 방법과도 원활하게 통합될 수 있다.
  • 온도는 전역 하이퍼파라미터가 아니라 샘플별로 동적으로 결정되므로, 다양한 예측 신뢰도 수준에서 소프트 레이블 품질이 향상된다.
  • 이 방법은 표준 KD 손실 계산 전에 샘플별 정규화 단계를 추가할 뿐이므로 계산 비용이 거의 증가하지 않으며, 부가적인 계산 비용이 거의 없다.

실험 결과

연구 질문

  • RQ1예측 신뢰도 분포가 매우 다양할 경우, 단일 고정 온도로는 모든 샘플의 로짓을 충분히 부드럽게 다룰 수 있는가?
  • RQ2로짓 분포 특성에 기반해 샘플별로 온도를 맞춤 설정하면 지식 증류 성능이 향상되는가?
  • RQ3기존 지식 증류에 대한 단순한, 저비용의 수정이 최첨단 특징 기반 방법과 비슷하거나 뛰어난 성능을 낼 수 있는가?
  • RQ4샘플별 온도 적응이 표현 공간 내에서 학생 및 교사 모델의 로짓 간 정렬에 어떤 영향을 미치는가?

주요 결과

  • ResNet-32×4를 교사 모델로, ResNet-8×4를 학생 모델로 사용할 때, CIFAR-100에서 NormKD는 상위-1 정확도 76.57%를 기록했으며, 일반적인 KD(73.33%)와 DKD(76.32%)를 모두 뛰어넘었다.
  • ImageNet에서 ResNet-50을 교사 모델로, MobileNet-V1을 학생 모델로 사용할 경우, NormKD는 일반적인 KD보다 0.3% 높은 정확도를 기록했고, DKD보다도 0.2% 높은 성능을 보였다.
  • DKD와 조합했을 때 NormKD는 성능을 추가로 향상시켜, 이 방법이 기존의 로짓 기반 접근법을 향상시킬 수 있음을 보여주었다.
  • 제거 실험 결과, $T_{norm}$(표준편차 기반)가 $V_{max}$ 및 $V_{max}-V_{min}$와 같은 다른 온도 변형들보다 가장 뛰어난 성능을 기록함을 확인했다.
  • NormKD의 학습 시간은 일반적인 KD와 거의 동일했으며(배치당 7.2ms 대비 7.1ms), 추가 파라미터가 없어 효율성이 확인되었다.
  • t-SNE 및 상관 행렬 시각화 결과, NormKD는 특히 정규화 후에 학생 및 교사 모델의 로짓 간 정렬이 향상되어 더 나은 지식 전이가 이루어짐을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.