Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge distillation for optimization of quantized deep neural networks

Sungho Shin, Yoonho Boo|arXiv (Cornell University)|2019. 09. 04.
Advanced Neural Network Applications참고 문헌 40인용 수 4
한 줄 요약

이 논문은 양자화된 딥 네ural 네트워크(QDNN)를 최적화하기 위해 점진적 소프트 손실 감소(GSLR) 기법을 사용한 지식 정련(KD)을 제안한다. 이는 소프트 레이블 분포—온도와 교사 모델 크기에 의해 제어되는 것—이 교사 모델 성능보다 더 중요하다는 것을 보여준다. 이는 온도 조절된 소프트 레이블과 소프트 손실을 점진적으로 감소시키는 강력한 트레이닝 스케줄링 전략을 활용하여, CIFAR-10과 CIFAR-100에서 2-bit ResNet20에 대해 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

Knowledge distillation (KD) is a very popular method for model size reduction. Recently, the technique is exploited for quantized deep neural networks (QDNNs) training as a way to restore the performance sacrificed by word-length reduction. KD, however, employs additional hyper-parameters, such as temperature, coefficient, and the size of teacher network for QDNN training. We analyze the effect of these hyper-parameters for QDNN optimization with KD. We find that these hyper-parameters are inter-related, and also introduce a simple and effective technique that reduces extit{coefficient} during training. With KD employing the proposed hyper-parameters, we achieve the test accuracy of 92.7% and 67.0% on Resnet20 with 2-bit ternary weights for CIFAR-10 and CIFAR-100 data sets, respectively.

연구 동기 및 목표

  • 교사 네트워크 선택과 KD 초모수가 양자화된 DNN 성능에 미치는 영향을 조사하는 것.
  • 저비트 네트워크에 대해 전체 정밀도 또는 양자화된 교사 모델이 더 나은 정련 결과를 낼지 결정하는 것.
  • QDNN의 KD에서 초모수 튜닝에 대한 의존도를 줄이는 강력한 트레이닝 전략을 개발하는 것.
  • 통제된 소프트 레이블 분포를 통해 CIFAR-10과 CIFAR-100에서 2-bit 양자화 네트워크의 정확도를 향상시키는 것.

제안 방법

  • 학생 네트워크가 하드 레이블과 소프트 레이블의 교합 손실을 포함하는 손실 함수를 사용하여 교사 네트워크의 소프트 레이블을 기반으로 훈련되는 지식 정련을 사용한다.
  • 소프트맥스 함수에서 온도(τ)를 사용하여 교사의 출력 분포의 소프트함을 제어한다.
  • 초기에는 하드 손실과 소프트 손실을 동일하게 가중하고, 훈련 중에 점차 소프트 손실 성분을 감소시키는 점진적 소프트 손실 감소(GSLR) 기법을 도입한다.
  • 전체 정밀도, 양자화, 지식 정련을 통한 교사-보조 아키텍처를 포함한 다양한 교사 모델을 평가한다.
  • 온도, 교사 크기, 손실 가중치(λ) 간의 상호작용을 분석하여 QDNN에 최적의 구성 요건을 규명한다.
  • 1-또는 2-bit 가중치 양자화를 위한 양자화 단계 크기(Δ)를 계산하기 위해 L2 오차 최소화 또는 표준편차를 사용한다.

실험 결과

연구 질문

  • RQ1QDNN의 KD에서 교사 네트워크의 성능보다 그 소프트 레이블 분포의 형태가 더 중요한가?
  • RQ2온도와 교사 모델 크기가 저정밀도 네트워크에서 정련 성능에 어떻게 함께 영향을 미치는가?
  • RQ3소프트 레이블 분포가 적절히 제어된다면 작은 교사 모델이 더 큰 모델을 능가할 수 있는가?
  • RQ4GSLR와 같은 동적 손실 스케줄링 전략은 초모수 민감도를 줄이고 트레이닝의 강건성을 향상시키는가?
  • RQ52-bit 양자화 모델의 훈련 중에 하드 손실과 소프트 손실 사이의 최적의 균형은 무엇인가?

주요 결과

  • 효율적인 정련을 위해 교사의 소프트 레이블 분포의 형태—온도와 모델 크기에 의해 제어되는 것—이 교사의 정확도 자체보다 더 중요하다.
  • 온도가 적절히 튜닝된 경우, 작은 교사 네트워크(예: ResNet20)도 더 큰 모델(예: WRN20x2)과 유사한 성능을 낼 수 있다.
  • CIFAR-10에서는 τ=4와 WRN20x1.7 교사에서 최적의 성능(94.8%)을 달성했고, CIFAR-100에서는 τ=1과 ResNet20에서 최고 성능(76.8%)을 기록했다.
  • 온도가 너무 높을 경우(예: CIFAR-100에서 τ>5), 소프트 레이블이 지나치게 평탄해져 지식 전달이 떨어지고 정확도가 65.49% 이하로 떨어진다.
  • GSLR 기법은 훈련의 안정성과 성능을 크게 향상시키며, 모든 교사 구성에서 하드 레이블 전용 훈련보다 결과가 유사하거나 더 좋다.
  • GSLR와 적절한 초모수 튜닝을 통해 본 논문은 CIFAR-10에서 2-bit ResNet20에 대해 최신 기술 수준의 정확도 94.8%와 CIFAR-100에서 76.8%를 달성하여 이전 방법들을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.