Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Quantization for Deep Neural Network

Yiren Zhou, Seyed-Mohsen Moosavi-Dezfooli|arXiv (Cornell University)|2017. 12. 04.
Advanced Image and Video Retrieval Techniques참고 문헌 3인용 수 15
한 줄 요약

이 논문은 깊이 신경망의 각 레이어에서 비트 폭을 최적화하기 위해 이론적으로 탄탄한 정량화 오차 영향 측정법을 사용하는 적응형 정량화 프레임워크를 제안한다. 레이어 간 정량화 노이즈의 누적 영향을 최소화함으로써, 동일 정확도 수준에서 등비트 폭 정량화 및 최신의 SQNR 기반 방법보다 20–40% 더 높은 압축 성능을 달성한다.

ABSTRACT

In recent years Deep Neural Networks (DNNs) have been rapidly developed in various applications, together with increasingly complex architectures. The performance gain of these DNNs generally comes with high computational costs and large memory consumption, which may not be affordable for mobile platforms. Deep model quantization can be used for reducing the computation and memory costs of DNNs, and deploying complex DNNs on mobile equipment. In this work, we propose an optimization framework for deep model quantization. First, we propose a measurement to estimate the effect of parameter quantization errors in individual layers on the overall model prediction accuracy. Then, we propose an optimization process based on this measurement for finding optimal quantization bit-width for each layer. This is the first work that theoretically analyse the relationship between parameter quantization errors of individual layers and model accuracy. Our new quantization algorithm outperforms previous quantization optimization methods, and achieves 20-40% higher compression rate compared to equal bit-width quantization at the same model prediction accuracy.

연구 동기 및 목표

  • 딥 네트워크 레이어 간 정량화에 대한 감도의 구조적 차이를 고려하지 못하는 등비트 폭 정량화의 비효율성을 해결하기 위해.
  • 개별 레이어의 정량화 오차가 전체 모델 정확도 저하에 미치는 영향을 이론적으로 탄탄한 메트릭으로 연결하기 위해.
  • 깊이 신경망에서 기하급수적 탐색이 불가능한 상황을 고려해 비어 있는 비용을 피하는 효율적인 비순환적 레이어별 비트 폭 최적화를 가능하게 하기 위해.
  • 특히 SQNR 기반 및 등비트 폭 방법에 비해 더 높은 압축 성능을 달성하면서 정확도를 유지함으로써 기존 정량화 방법을 초월하기 위해.

제안 방법

  • 각 레이어의 정량화 노이즈가 전체 모델 예측 정확도에 미치는 영향을 측정하기 위해 잔차 오차 벡터의 L2 노름 기반 측정법을 제안한다.
  • 소규모 노이즈 조건에서 레이어 간 총 정량화 오차가 약간의 덧셈적 성질을 가지며, 이는 확장 가능한 최적화를 가능하게 한다는 이론적 프레임워크를 유도한다.
  • 이 덧셈 오차 모델을 사용해 총 오차를 최소화하면서 정확도 제약 조건을 충족하는 각 레이어의 최적 비트 폭을 계산한다.
  • 제안된 오차 측정법에 기반해 각 레이어에서 균일 정량화를 적용하며, 비트 폭 조합의 전수 검색을 피한다.
  • ImageNet 모델에서 덧셈성 가정을 실증적으로 검증하여, 저노이즈 조건에서 강한 일치를 보임을 확인한다.
  • 압축과 정확도를 레이어 간 균형 있게 유지하는 경량 기반의 반복적 절차를 사용해 비트 폭을 최적화한다.

실험 결과

연구 질문

  • RQ1딥 네트워크의 개별 레이어에서의 정량화 오차가 전체 모델 예측 정확도에 어떻게 누적적으로 영향을 미치는가?
  • RQ2이론적으로 탄탄한 덧셈 오차 모델이 레이어별 정량화 영향을 최종 모델 성능에 정확하게 예측할 수 있는가?
  • RQ3레이어별 적응형 비트 폭 할당이 압축-정확도 트레이드오프 측면에서 등비트 또는 SQNR 기반 비트 폭 선택보다 뛰어나게 성능을 발휘할 수 있는가?
  • RQ4이러한 방법이 AlexNet, VGG-16, GoogleNet, ResNet-50와 같은 다양한 딥 네트워크 아키텍처에 대해 확장 가능하고 효과적인가?

주요 결과

  • AlexNet과 VGG-16에서 동일한 정확도 저하 수준에서 제안된 방법은 등비트 폭 정량화보다 모델 크기를 30–40% 더 작게 만든다.
  • GoogleNet과 ResNet-50에서는 동일한 정확도 제약 조건 하에서 등비트 폭 정량화보다 모델 크기를 15–20% 더 작게 만든다.
  • 모든 테스트된 모델에서 SQNR 기반 정량화 방법에 비해 일관되게 우수한 성능을 발휘하며, 특히 SQNR 기반 방법이 성능을 저하시키는 ResNet-50에서도 뛰어난 성능을 보였다.
  • 실증적 검증을 통해 저노이즈 조건 하에서 정량화 오차 노름의 덧셈성이 확인되어, 이론적 기반을 뒷받침한다.
  • 분수 비트 폭 최적화 덕분에 SQNR 기반 방법보다 더 많은 비트 폭 조합을 생성함으로써 더 정교한 압축 제어가 가능하다.
  • 이론적 분석을 통해 레이어별 정량화 오차와 전체 DNN 정확도 사이의 선구적인 연결 고리를 수립하여, 적응형 정량화의 체계적인 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.