Skip to main content
QUICK REVIEW

[논문 리뷰] Residual Knowledge Distillation

Mengya Gao, Yujun Shen|arXiv (Cornell University)|2020. 02. 21.
Advanced Neural Network Applications참고 문헌 24인용 수 20
한 줄 요약

이 논문은 잔차 오차를 학습하기 위해 보조 모델을 도입함으로써 지식 증류를 향상시키는 새로운 모델 압축 방법인 잔차 지식 증류(RKD)를 제안한다. 단일 학생 모델을 학생과 경량 보조 모델으로 분리함으로써 계산 비용을 증가시키지 않으면서도, 기존 방법에 비해 ImageNet에서 ResNet-18 정확도를 2.0% 향상시키는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Knowledge distillation (KD) is one of the most potent ways for model compression. The key idea is to transfer the knowledge from a deep teacher model (T) to a shallower student (S). However, existing methods suffer from performance degradation due to the substantial gap between the learning capacities of S and T. To remedy this problem, this work proposes Residual Knowledge Distillation (RKD), which further distills the knowledge by introducing an assistant (A). Specifically, S is trained to mimic the feature maps of T, and A aids this process by learning the residual error between them. In this way, S and A complement with each other to get better knowledge from T. Furthermore, we devise an effective method to derive S and A from a given model without increasing the total computational cost. Extensive experiments show that our approach achieves appealing results on popular classification datasets, CIFAR-100 and ImageNet, surpassing state-of-the-art methods.

연구 동기 및 목표

  • 학생 모델의 능력이 제한되어 있어 지식 증류 과정에서 학생과 교사 모델 간 성능 격차가 발생하는 문제를 해결하기 위해.
  • 일대일 모방에 의존하는 단일 단계가 아닌, 이중 단계 증류 과정을 도입함으로써 지식 전이 효율을 향상시키기 위해.
  • 총 FLOPs를 늘리지 않으면서도 학생과 보조 모델 간 계산 자원을 할당할 수 있는 모델 분리 기법을 개발하기 위해.
  • 경량 보조 모델이 잔차 오차를 효과적으로 학습하고 학생 성능을 크게 향상시킬 수 있음을 경험적으로 검증하기 위해.
  • AT와 같은 다른 증류 방법과의 조합을 통해 RKD의 일반화 잠재력을 입증하기 위해.

제안 방법

  • 보조 모델 A가 학생 S와 교사 T의 특징 맵 간 잔차 오차를 학습하도록 도입한다.
  • 최종 학생 출력은 S와 A의 특징 맵을 합산하여 형성되며, 이는 교사 출력과의 보다 나은 정렬을 가능하게 한다.
  • 총 FLOPs가 그대로 유지되도록 단일 모델에서 S와 A를 유도하는 모델 분리 기법을 제안한다.
  • 보조 모델 A는 A의 출력과 T 및 S 특징 맵 간의 차이(잔차) 사이의 L2 손실을 최소화하도록 훈련된다.
  • 잔차 오차를 정의할 수 있다면 특징 맵과 주의 맵을 포함한 다양한 지식 유형과 호환된다.
  • S가 T를 모방하도록 훈련하고, A는 잔차 오차를 학습함으로써 일반화와 정확도 향상에 기여한다.

실험 결과

연구 질문

  • RQ1학생과 교사 특징 맵 간의 잔차 오차를 학습하는 보조 모델을 도입하면 지식 증류 성능이 향상되는가?
  • RQ2RKD의 이중 단계 증류 과정이 학생과 교사 모델 간 능력 격차로 인한 성능 저하를 줄이는가?
  • RQ3계산 비용을 증가시키지 않으면서도 경량 보조 모델이 상당한 성능 향상을 이룰 수 있는가?
  • RQ4다양한 데이터셋에서 RKD가 KD, FitNets, AT와 같은 최신 기술 수준의 지식 증류 방법보다 어떻게 비교되는가?
  • RQ5RKD는 주의 증류(AT)와 같은 다른 증류 전략과도 일반화되어 작동할 수 있는가?

주요 결과

  • ResNet-34에서 ResNet-18로 지식을 전달할 때, RKD는 ImageNet에서 2.0%의 상위-1 정확도 향상을 기록하여, 이전 최고 성능 방법보다 1.2% 높게 기록한다.
  • CIFAR-100에서는 RKD가 기본 KD 방법 대비 학생 정확도를 2.75% 향상시켰으며, 교사 성능에 매우 가까이 다가섰다.
  • 학생 모델의 계산 비용의 6.25%에 불과한 경량 보조 모델(ResNet-18-1/4)을 사용함으로써, RKD는 0.87% 높은 정확도를 확보하여 효율성을 입증했다.
  • 보조 모델이 교사 모델만큼 크기(ResNet-34)여도 성능이 교사에 도달하지 못함을 확인하여, 경량 A가 충분하고 최적임을 시사한다.
  • AT와 결합한 RKD는 ImageNet에서 71.54%의 상위-1 정확도를 기록하여, 잔차 학습 전략이 다른 증류 방법으로도 잘 일반화됨을 보여준다.
  • CIFAR-100에서의 시각화 결과, RKD는 특히 초기 블록에서 기존 방법보다 더 분류 능력이 뛰어난 특징 맵을 생성함을 확인할 수 있었다. 이는 효과적인 잔차 오차 학습 덕분이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.