Skip to main content
QUICK REVIEW

[논문 리뷰] Distilling with Performance Enhanced Students

Jack Turner, Elliot J. Crowley|arXiv (Cornell University)|2018. 10. 24.
Advanced Neural Network Applications참고 문헌 36인용 수 4
한 줄 요약

이 논문은 Fisher 프루닝과 실측 하드웨어 프로파일링을 조합하여 최적의 레이어 너비를 식별함으로써 성능 향상된 학생 네트워크를 발견하는 지연 시간 인식 디스틸레이션 방법을 제안한다. 추론 속도 향상의 단계적 패턴을 활용함으로써, 동일한 지연 시간에서 표준 채널 프루닝 모델 대비 상위-1 ImageNet 정확도를 10퍼센트 이상 향상시켰으며, 추론 시간을 증가시키지 않고도 더 높은 정확도를 달성하였다.

ABSTRACT

The task of accelerating large neural networks on general purpose hardware has, in recent years, prompted the use of channel pruning to reduce network size. However, the efficacy of pruning based approaches has since been called into question. In this paper, we turn to distillation for model compression---specifically, attention transfer---and develop a simple method for discovering performance enhanced student networks. We combine channel saliency metrics with empirical observations of runtime performance to design more accurate networks for a given latency budget. We apply our methodology to residual and densely-connected networks, and show that we are able to find resource-efficient student networks on different hardware platforms while maintaining very high accuracy. These performance-enhanced student networks achieve up to 10% boosts in top-1 ImageNet accuracy over their channel-pruned counterparts for the same inference time.

연구 동기 및 목표

  • 일般적인 프로세서 하드웨어에서 비선형적인 추론 시간 스케일링으로 인해 표준 채널 프루닝이 성능이 떨어지는 문제를 해결하기 위해.
  • 추론 시간의 근사치로 FLOPs를 사용하는 것의 한계를 극복하기 위해, 하드웨어 특화 성능 병목 현상을 반영하지 못하는 문제를 해결하기 위해.
  • 프루닝과 실측 하드웨어 프로파일링을 융합하여 저지연, 고정확도 학생 네트워크를 발견하는 방법을 개발하기 위해.
  • 고정된 지연 예산 내에서 정확도를 최대화하는 성능 향상된 아키텍처를 식별함으로써 모델 압축을 향상시키기 위해.
  • 제안된 방법이 여러 하드웨어 플랫폼과 데이터셋에서 ResNet, WideResNet, DenseNet에 대해 효과적인지 입증하기 위해.

제안 방법

  • 사전 학습된 교사 네트워크에 Fisher 프루닝을 적용하여, 매 100학습 스텝마다 한 채널씩 제거하여 프루닝 가능한 채널이 모두 제거될 때까지 진행한다.
  • 대상 하드웨어에서 실측 추론 시간 측정을 통해, 장치의 병렬 처리를 최적화한 상태에서 성능이 효율적으로 향상되는 '스테어케이스(계단형) 점'을 식별한다.
  • 이러한 최적 지점에서의 레이어 너비를 선택하여 지연 시간 인식 및 성능 최적화된 학생 아키텍처를 구성하며, 비효율적인 FLOP 기반 근사치를 피한다.
  • 기존 교사 네트워크를 사용하여 특징 표현 학습을 안내하는 주의 전달을 포함한 지식 디스틸레이션을 통해 최종 학생 네트워크를 학습시킨다.
  • 교수 손실과 교차 엔트로피 손실 간의 균형을 조절하기 위해 β(이미지넷의 경우 750, CIFAR의 경우 1000으로 설정)를 포함한 디스틸레이션 손실을 최적화한다.
  • SGD를 사용하여 학생 네트워크를 미세조정하며, 모멘텀 0.9, 가중치 감쇠 0.0001, 90 에포크 동안 코즈인 감쇠 스케줄을 적용한다.

실험 결과

연구 질문

  • RQ1FLOP 기반 메트릭스가 포착하지 못하는 하드웨어 특화 성능 최적화 레이어 너비를 신경망에서 식별할 수 있는가?
  • RQ2실측 하드웨어 프로파일링과 디스틸레이션을 융합하면 동일한 지연 시간에서 표준 프루닝 대비 더 높은 정확도의 학생 네트워크를 얻을 수 있는가?
  • RQ3성능 향상된 학생 네트워크가 엣지 디바이스에서 지연 시간을 증가시키지 않고 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4제안된 방법은 다양한 네트워크 아키텍처(예: ResNet, DenseNet, WideResNet)와 데이터셋(예: CIFAR-10, ImageNet)에서 어떻게 확장되는가?
  • RQ5추론 시간의 스테어케이스 패턴을 활용하여 지연 시간을 희생시키지 않고 네트워크 용량을 증가시킬 수 있는가?

주요 결과

  • ResNet-34를 사용한 ImageNet에서, 성능 향상된 학생 네트워크는 상위-1 오차율 32.29%를 기록하였으며, 이는 75%의 파라미터 압축 비율에서 Fisher 프루닝 모델 대비 10퍼센트 이상의 향상이다.
  • 프루닝 모델의 상위-1 오차율이 20% 증가(43.43%)했음에도 불구하고, 성능 향상된 학생 네트워크는 동일한 추론 시간을 유지하여 지연 시간 비용이 없음을 입증하였다.
  • ARM Cortex-A57 하드웨어에서, 하드웨어 병렬 처리로 인해 비선형적이고 계단형 패턴을 보이는 추론 시간이 관찰되어, 최적의 레이어 너비를 성공적으로 식별하였다.
  • 지연 시간을 유지하면서도 채널 프루닝 기반 베이스라인 대비 정확도를 10퍼센트 이상 향상시켜, 하드웨어 인식 아키텍처 탐색의 가치를 입증하였다.
  • 프루닝 모델보다 더 높은 MACs와 파라미터 수를 가졌음에도 불구하고, 지연 시간 프로파일의 최적 지점에 대응함으로써 동일한 추론 속도를 유지하였다.
  • 이 기법은 아키텍처와 데이터셋 간에 일반화 가능하며, 최소한의 아키텍처 변경으로서 CIFAR-10과 ImageNet 모두에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.