Skip to main content
QUICK REVIEW

[논문 리뷰] Densely Guided Knowledge Distillation using Multiple Teacher Assistants

Wonchul Son, Jaemin Na|arXiv (Cornell University)|2020. 09. 18.
Advanced Neural Network Applications참고 문헌 41인용 수 14
한 줄 요약

이 논문은 대용량 차이가 존재할 때 지식 증류에서 오류 누적 문제를 완화하기 위해 다수의 트레이너 어시스턴트를 사용하는 Densely Guided Knowledge Distillation (DGKD)를 제안한다. 이는 기존의 트레이너 모델과 이전에 훈련된 모든 고수준 트레이너 어시스턴트를 통해 각 더 작은 트레이너 어시스턴트를 지속적으로 가이드하여 지식 전달을 향상시키고 오류 전파를 줄인다. 이 방법은 최신 기술 수준의 성능을 달성하여, ResNet 기반 모델을 사용할 때 CIFAR-100에서 TAKD 대비 정확도를 최대 5.01% 향상시킨다.

ABSTRACT

With the success of deep neural networks, knowledge distillation which guides the learning of a small student network from a large teacher network is being actively studied for model compression and transfer learning. However, few studies have been performed to resolve the poor learning issue of the student network when the student and teacher model sizes significantly differ. In this paper, we propose a densely guided knowledge distillation using multiple teacher assistants that gradually decreases the model size to efficiently bridge the large gap between the teacher and student networks. To stimulate more efficient learning of the student network, we guide each teacher assistant to every other smaller teacher assistants iteratively. Specifically, when teaching a smaller teacher assistant at the next step, the existing larger teacher assistants from the previous step are used as well as the teacher network. Moreover, we design stochastic teaching where, for each mini-batch, a teacher or teacher assistants are randomly dropped. This acts as a regularizer to improve the efficiency of teaching of the student network. Thus, the student can always learn salient distilled knowledge from the multiple sources. We verified the effectiveness of the proposed method for a classification task using CIFAR-10, CIFAR-100, and ImageNet. We also achieved significant performance improvements with various backbone architectures such as ResNet, WideResNet, and VGG.

연구 동기 및 목표

  • 학생 네트워크가 트레이너보다 훨씬 작을 때 지식 증류에서 오류 누적 문제를 해결하기 위해.
  • 트레이너와 학생 간의 모델 크기 격차가 클 경우 지식 전달 효율을 향상시키기 위해.
  • 스티오스틱 지식 증류를 도입하여 학생 훈련 중 과적합을 줄이기 위해.
  • 다수의 중간 단계 트레이너 어시스턴트를 사용하여 더 견고하고 확장 가능한 증류 경로를 가능하게 하기 위해.

제안 방법

  • 이 방법은 원래 트레이너 모델에서 시작하여 점차 용량이 감소하는 다수의 트레이너 어시스턴트(TA)의 계단식 구조를 사용한다.
  • 각 TA는 이전 수준의 TA뿐 아니라 모든 고수준 트레이너 어시스턴트와 원래 트레이너로부터 지식 증류를 통해 훈련되며, 이는 조밀한 가이드라인을 보장한다.
  • 출력 확률와 내부 표현을 모두 전달하기 위해 소프트 레이블과 중간 특징 맵을 사용하여 지식 증류를 수행한다.
  • 스티오스틱 가르침 전략이 도입되며, 각 미니배치에서 랜덤으로 선택된 일부 트레이너와 TA들이 지식을 증류하여 정규화 역할을 한다.
  • 훈련 과정은 T → A1 → A2 → ... → S의 다단계 증류 경로를 사용하며, 각 단계에서 이전에 존재하는 모든 트레이너를 활용하여 더 견고한 지식 전달을 실현한다.
  • 이 방법은 ResNet, WideResNet, VGG 등의 다양한 백본 아키텍처와 CIFAR-10, CIFAR-100, ImageNet 등의 데이터셋에서 평가되어 일반화 가능성과 확장성의 우수함을 입증한다.

실험 결과

연구 질문

  • RQ1학생 모델이 트레이너 모델보다 훨씬 작을 경우, 다수의 중간 단계 트레이너 어시스턴트가 지식 증류 성능을 향상시킬 수 있는가?
  • RQ2모든 고수준 트레이너 어시스턴트와 원래 트레이너로부터의 조밀한 지식 증류가 순차적 TA 훈련에 비해 오류 누적 문제를 줄일 수 있는가?
  • RQ3랜덤으로 제거된 트레이너들로부터의 스티오스틱 지식 증류가 학생 훈련의 일반화 능력 향상과 과적합 감소에 기여하는가?
  • RQ4다양한 아키텍처와 데이터셋에서 최신 기술 수준의 KD 방법들과 비교해 볼 때, 제안된 방법은 정확도와 견고성 측면에서 어떤가?

주요 결과

  • 제안된 스티오스틱 DGKD는 ResNet-18 학생 모델을 사용해 ImageNet에서 92.34%의 top-1 정확도를 달성하여 원래 DGKD와 TAKD를 초월했다.
  • 16×2 WideResNet 학생 모델을 사용한 CIFAR-100에서 스티오스틱 DGKD는 90.54%의 정확도를 기록했으며, TAKD 대비 5.01% 향상되었고, 비스티오스틱 DGKD 대비 1.23% 향상되었다.
  • CIFAR-10에서 20층의 ResNet 학생 모델을 사용한 경우, 이 방법은 대용량 격차가 존재하는 상황에서도 91.23%의 정확도를 달성하여 뛰어난 성능을 보였다.
  • VGG13→VGG8 설정에서 이 방법은 74.40%의 정확도를 기록하여 최신 기술 수준의 방법들 중 두 번째로 높은 성능을 보였으며, 중간 수준의 모델 격차 상황에서도 강력한 성능을 입증했다.
  • 모든 평가된 백본 아키텍처와 데이터셋에서 기준 KD, FitNet, AT, SP, RKD, TAKD를 일관되게 뛰어넘었다.
  • 제거 분석 결과, 스티오스틱 증류 전략이 일반화 능력을 크게 향상시키며 과적합을 감소시키고 학생 성능을 향상시킨다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.