Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge distillation via adaptive instance normalization

Jing Yang, Brais Martínez|arXiv (Cornell University)|2020. 03. 09.
Generative Adversarial Networks and Image Synthesis참고 문헌 43인용 수 16
한 줄 요약

이 논문은 적응형 인스턴스 정규화(AdaIN)를 사용하여 교사 네트워크에서 학생 네트워크로 채널별 특징 통계(평균 및 분산)를 전달하는 새로운 지식 정련 방법을 제안한다. 교사가 전달된 통계의 신뢰성을 평가하는 피드백 루프를 통해 학생의 통계를 보정함으로써, 다양한 아키텍처, 데이터셋, 도메인에서 최신 기술(SOTA) 성능을 달성한다. 이는 ImageNet 및 CIFAR-100에서의 실수에서 이진 네트워크로의 정련을 포함한다.

ABSTRACT

This paper addresses the problem of model compression via knowledge distillation. To this end, we propose a new knowledge distillation method based on transferring feature statistics, specifically the channel-wise mean and variance, from the teacher to the student. Our method goes beyond the standard way of enforcing the mean and variance of the student to be similar to those of the teacher through an $L_2$ loss, which we found it to be of limited effectiveness. Specifically, we propose a new loss based on adaptive instance normalization to effectively transfer the feature statistics. The main idea is to transfer the learned statistics back to the teacher via adaptive instance normalization (conditioned on the student) and let the teacher network "evaluate" via a loss whether the statistics learned by the student are reliably transferred. We show that our distillation method outperforms other state-of-the-art distillation methods over a large set of experimental settings including different (a) network architectures, (b) teacher-student capacities, (c) datasets, and (d) domains.

연구 동기 및 목표

  • 지식 정련 중 특징 통계를 전달할 때 표준 L2 손실의 한계를 해결한다.
  • 교사에서 학생 네트워크로 채널별 평균 및 분산을 더 효과적으로 전달함으로써 모델 압축을 향상시킨다.
  • 교사가 전달된 통계의 신뢰성을 평가하는 피드백 메커니즘을 개발하여 학습 효율성을 향상시킨다.
  • 다양한 설정에서 일관된 성능 향상을 입증한다: 서로 다른 네트워크 아키텍처, 교사-학생 성능 비율, 데이터셋(CIFAR-10/100, ImageNet), 도메인(실수형에서 이진 네트워크로의 정련)을 포함한다.

제안 방법

  • 학습된 채널별 평균 및 분산을 학생에서 교사로 되돌려보내는 데 기반한 새로운 손실 함수를 제안한다. 이는 적응형 인스턴스 정규화(AdaIN)를 사용한다.
  • 학생의 통계를 스케일 및 시프트 파rameter로 사용하여 교사의 특징 맵에 인스턴스 정규화를 적용한다.
  • 적응된 교사의 출력과 원본 교사의 출력 사이의 L2 손실을 최소화하도록 학생을 훈련시켜, 전달된 통계가 성능을 떨어뜨리지 않도록 보장한다.
  • 교사의 피드백 신호를 활용해 학생을 감독함으로써, 통계 전달을 위한 자기 수정 메커니즘을 구축한다.
  • 표준 정련 목표(예: 로짓에 대한 KL 발산)와 제안된 손실을 통합하여 동시 최적화를 수행한다.
  • 훈련 기간 동안 전체 프로세스를 엔드 투 엔드로 적용하며, 학생만 업데이트하고, 추론 시에는 교사가 고정된다.

실험 결과

연구 질문

  • RQ1교사에서 학생으로 채널별 특징 통계(평균 및 분산)를 전달함으로써 표준 L2 손실을 초월해 지식 정련 성능을 향상시킬 수 있는가?
  • RQ2학생에서 교사로의 피드백 루프를 생성하기 위해 적응형 인스턴스 정규화를 사용함으로써 통계 전달의 신뢰성과 효과성이 향상되는가?
  • RQ3다양한 네트워크 아키텍처와 데이터셋 도메인에서 제안된 방법이 최신 기술 정련 기법과 비교해 어떻게 성능을 내는가?
  • RQ4실수형에서 이진 네트워크로의 정련과 같은 도전적인 설정에서 지식 전달이 효과적으로 이루어지는가?
  • RQ5교사 평가를 통한 피드백 메커니즘이 표준 정련 손실에 비해 일반화 능력과 성능을 향상시키는가?

주요 결과

  • ResNet-34(21.8M 파라미터)에서 ResNet-18(11.69M 파라미터)로 정련할 때 ImageNet-1K에서 71.82%의 상위-1 정확도를 달성하며, CRD 및 RKD를 포함한 모든 베이스라인을 초월한다.
  • 동일한 설정에서 교사와 학생 간 정확도 격차를 2.36%로 줄였으며, CRD의 1.27%에 비해 우수한 성능 향상을 보였다.
  • ResNet-50(25.56M 파라미터)에서 MobileNet(4.23M 파라미터)으로 정련할 경우 72.49%의 상위-1 정확도를 달성하여, 두 번째로 우수한 방법(CRD, 71.40%)을 1.09%포인트 초월했다.
  • CIFAR-100에서 실수형에서 이진 네트워크로의 정련 시, ResNet-34 교사와 이진 학생 네트워크를 사용해 70.15%의 상위-1 정확도를 기록했으며, 다음으로 우수한 방법(OFD)을 2.39%포인트 초월했다.
  • 이진 학생 네트워크를 사용한 ImageNet-1K에서의 정련에서는 70.20%의 상위-1 정확도를 달성했으며, KD(56.70%), AT(58.45%), CRD(58.25%)를 크게 앞서며 뚜렷한 성능 우위를 보였다.
  • 모든 평가된 설정에서 일관되게 성능 향상을 보였으며, 서로 다른 아키텍처, 데이터셋 규모, 도메인을 포함하여 강력한 일반화 능력과 확장성(스케일러빌리티)을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.