Skip to main content
QUICK REVIEW

[논문 리뷰] Decoupled Knowledge Distillation

Borui Zhao, Quan Cui|arXiv (Cornell University)|2022. 03. 16.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 전통적인 KD의 한계를 극복하기 위해 타겟 클래스 지식 희석(TCKD)과 비타겟 클래스 지식 희석(NCKD)을 분리하는 새로운 로짓 기반 희석 방법인 분리된 지식 희석(DKD)을 제안한다. 이 성분들을 분리함으로써 DKD는 이미지 분류 및 객체 검출 작업에서 훈련 효율성과 성능을 향상시키며, 복잡한 특징 기반 방법과 유사한 최신 기술 성능을 달성하면서도 최소한의 계산 비용으로 구현된다.

ABSTRACT

State-of-the-art distillation methods are mainly based on distilling deep features from intermediate layers, while the significance of logit distillation is greatly overlooked. To provide a novel viewpoint to study logit distillation, we reformulate the classical KD loss into two parts, i.e., target class knowledge distillation (TCKD) and non-target class knowledge distillation (NCKD). We empirically investigate and prove the effects of the two parts: TCKD transfers knowledge concerning the "difficulty" of training samples, while NCKD is the prominent reason why logit distillation works. More importantly, we reveal that the classical KD loss is a coupled formulation, which (1) suppresses the effectiveness of NCKD and (2) limits the flexibility to balance these two parts. To address these issues, we present Decoupled Knowledge Distillation (DKD), enabling TCKD and NCKD to play their roles more efficiently and flexibly. Compared with complex feature-based methods, our DKD achieves comparable or even better results and has better training efficiency on CIFAR-100, ImageNet, and MS-COCO datasets for image classification and object detection tasks. This paper proves the great potential of logit distillation, and we hope it will be helpful for future research. The code is available at https://github.com/megvii-research/mdistiller.

연구 동기 및 목표

  • 로짓 기반 희석이 낮은 계산 비용에도 불구하고 특징 기반 희석보다 성능이 열 劣하는 이유를 조사하기 위해.
  • 로짓 희석에서 타겟 클래스와 비타겟 클래스 지식의 역할을 분석하기 위해.
  • 기존 KD 손실에서의 결합이 지식 전달의 효과성과 유연성을 저하시키는 핵심 제약 요소임을 규명하기 위해.
  • TCKD와 NCKD를 독립적으로 최적화할 수 있는 분리된 프레임워크를 제안하여 희석 성능과 효율성을 향상시키기 위해.
  • 이미지 분류 및 객체 검출 벤치마크에서 DKD의 훈련 속도, 모델 일반화 능력, 이식 가능성에서의 우수성을 검증하기 위해.

제안 방법

  • 기존 KD 손실을 타겟 클래스 지식 희석(TCKD)과 비타겟 클래스 지식 희석(NCKD)으로 두 개의 성분으로 재구성하여 독립적인 분석이 가능하도록 한다.
  • 비타겟 클래스 지식 희석(NCKD) 손실을 타겟 클래스에 대한 교사의 신뢰도에서 분리하기 위해 계수 $1 - p_t^{ au}$ 를 학습 가능한 상수 $\beta$ 로 대체함으로써 잘 예측된 샘플에서의 억제를 제거한다.
  • TCKD의 기여도를 제어하기 위해 학습 가능한 하이퍼파ram터 $\alpha$ 를 도입하여 난이도 인식 및 클래스 간 대비 지식 전달 간의 탄력적 균형 조절이 가능하도록 한다.
  • DKD를 훈련 중인 학생 네트워크에 적용하며, 교사 및 학생의 로짓만 사용하여 중간 특징 추출 및 저장에 필요한 고비용 연산을 피한다.
  • t-SNE 및 상관계수 행렬 시각화를 통해 KD와 DKD 간의 특징 구분 가능성과 로짓 유사도를 비교한다.
  • CIFAR-100, ImageNet 및 MS-COCO에서의 추론 성능, 훈련 효율성, 특징 이식 가능성 평가를 위한 아블레이션 스터디를 수행한다.
(a) Classical Knowledge Distillation (KD).
(a) Classical Knowledge Distillation (KD).

실험 결과

연구 질문

  • RQ1로짓 희석에서 타겟 클래스 지식 희석(TCKD)과 비타겟 클래스 지식 희석(NCKD)의 각각의 기여도는 무엇인가?
  • RQ2로짓의 의미적 풍부함에도 불구하고 기존 지식 희석이 왜 성능이 열 劣하는가?
  • RQ3NCKD와 교사의 타겟 클래스에 대한 신뢰도 간의 결합이 지식 전달 효과성에 어떻게 영향을 미치는가?
  • RQ4중간 특징 희석에 의존하지 않고도 TCKD와 NCKD를 분리함으로써 희석 성능과 훈련 효율성을 향상시킬 수 있는가?
  • RQ5큰 모델에서 NCKD의 억제를 줄임으로써 '더 큰 교사, 더 나쁜 성능'의 역설을 DKD가 완화하는가?

주요 결과

  • 비타겟 클래스 지식 희석(NCKD)이 로짓 희석에서 성능 향상의 주요 원동력이며, 오직 NCKD만을 사용하는 모델가 기존 KD와 유사하거나 더 높은 성능을 달성한다.
  • 기존 KD는 NCKD를 타겟 클래스에 대한 교사의 신뢰도와 결합함으로써 잘 예측된 샘플에서 NCKD가 억제되며, 이는 지식 전달의 효과성을 제한한다.
  • CIFAR-100에서 ResNet8×4 학생과 ResNet32×4 교사 조합으로 DKD는 76.45%의 상위-1 정확도를 기록하여 KD(75.04%)를 초월하며 뛰어난 훈련 효율성을 보였다.
  • ImageNet에서는 ResNet50 교사와 WRN-16-2 학생 조합으로 DKD가 76.60%의 상위-1 정확도를 달성하여 KD(75.36%)를 능가했으며, 후속 작업에서의 특징 이식 가능성도 향상되었다.
  • DKD는 특징 이식 가능성을 향상시켰다: STL-10과 Tiny-ImageNet에서의 선형 프로빙 결과 DKD는 각각 72.9%와 37.1%의 정확도를 기록하여 KD(70.9% 및 33.9%)를 능가했다.
  • 시각화 결과 DKD가 더 분리 가능한 특징(t-SNE)을 생성하고, 학생의 로짓이 교사의 로짓과 더 잘 일치함(correlation matrix)을 보여, 훨씬 뛰어난 지식 전달 능력을 가짐을 확인했다.
(b) Decoupled Knowledge Distillation (DKD).
(b) Decoupled Knowledge Distillation (DKD).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.