Skip to main content
QUICK REVIEW

[논문 리뷰] Convolutional Neural Network Quantization using Generalized Gamma Distribution

Doyun Kim, Han Young Yim|arXiv (Cornell University)|2018. 10. 31.
Advanced Neural Network Applications참고 문헌 17인용 수 4
한 줄 요약

이 논문은 컨볼루션 신경망(CNNs)을 위한 새로운 양자화 방법을 제안하며, 특징맵 활성화를 모델링하고 최적의 양자화 단계 크기를 최적화하기 위해 일반화된 감마 분포(GGD)를 사용한다. 이는 최대 신호 대 양자화 노이즈 비율(SQNR)을 달성하기 위한 것이다. 가중치와 편향은 분수 길이 선택을 통해 별도로 최적화되며, 정확도를 향상시키기 위해 후진-전진 튜닝(BFT) 절차가 적용되어, GoogLeNet, AlexNet, VGG-16 등의 모델에서 저정밀도 추론 시 근접한 부동소수점 성능을 달성한다.

ABSTRACT

As edge applications using convolutional neural networks (CNN) models grow, it is becoming necessary to introduce dedicated hardware accelerators in which network parameters and feature-map data are represented with limited precision. In this paper we propose a novel quantization algorithm for energy-efficient deployment of the hardware accelerators. For weights and biases, the optimal bit length of the fractional part is determined so that the quantization error is minimized over their distribution. For feature-map data, meanwhile, their sample distribution is well approximated with the generalized gamma distribution (GGD), and accordingly the optimal quantization step size can be obtained through the asymptotical closed form solution of GGD. The proposed quantization algorithm has a higher signal-to-quantization-noise ratio (SQNR) than other quantization schemes previously proposed for CNNs, and even can be more improved by tuning the quantization parameters, resulting in efficient implementation of the hardware accelerators for CNNs in terms of power consumption and memory bandwidth.

연구 동기 및 목표

  • 한정된 전력과 메모리 대역폭을 가진 엣지 디바이스에 저정밀도 CNN을 구현하는 데 도전하는 데 목적을 두며.
  • 재학습이 필요 없이 가중치, 편향 및 특징맵의 양자화 오차를 최소화하는 데 목적을 두며.
  • SQNR를 극대화하면서도 높은 추론 정확도를 유지하는 하드웨어 우수한 양자화 체계를 개발하는 데 목적을 두며.
  • 최적화된 비트 폭 할당과 양자화 파rameter 튜닝을 통해 CNN 가속기의 효율적 구현을 가능하게 하는 데 목적을 두며.

제안 방법

  • 모든 CNN 레이어의 특징맵 분포를 일반화된 감마 분포(GGD)로 모델링하여 최적의 양자화 단계 크기를 점점 더 정확하게 유도할 수 있도록 한다.
  • 실제 분포를 기반으로 한 평균 제곱 오차를 최소화함으로써 가중치와 편향의 분수 길이를 최적화한다.
  • 양자화 이후 정확도를 향상시키기 위해 후진-전진 튜닝(BFT) 알고리즘을 적용하여 재학습 없이도 파rameter를 보정한다.
  • 두 단계 과정을 사용한다: 첫 번째로 가중치와 특징맵에 대해 SQNR를 극대화하는 양자화; 두 번째로 BFT를 통해 실제 네트워크 성능에 맞게 양자화를 조정한다.
  • 각 레이어의 가중치 및 활성화 분포의 통계적 특성에 맞게 맞춤형 비균일 양자화 전략을 적용한다.
  • 혼합 정밀도 양자화를 지원하여 가중치와 특징맵에 대해 서로 다른 비트 폭(예: w8/fm4)을 허용함으로써 정확도와 자원 사용 간의 트레이드오프를 가능하게 한다.

실험 결과

연구 질문

  • RQ1일반화된 감마 분포(GGD)는 CNN 레이어 전반의 특징맵 활성화의 통계 분포를 정확하게 모델링할 수 있는가?
  • RQ2GGD 기반의 양자화는 CNN 특징맵에 대해 균일하거나 다른 분포 기반의 양자화 방식보다 더 높은 SQNR를 달성하는가?
  • RQ3후진-전진 튜닝(BFT)은 재학습 없이도 양자화 이후 정확도를 효과적으로 향상시킬 수 있는가?
  • RQ4저비트 폭에서 이전의 양자화 체계와 비교해 본다면, 제안된 방법은 정확도와 에너지 효율성 측면에서 어떻게 성능을 내는가?

주요 결과

  • 8비트 가중치와 4비트 특징맵을 사용할 때 GoogLeNet에서 68.6%의 Top-1 정확도를 달성하였으며, 부동소수점 기준으로 4.4%의 감소에 그친다.
  • 6비트 가중치와 6비트 특징맵을 사용할 경우 GoogLeNet에서 66.7%의 Top-1 정확도를 기록하여 저비트 폭에서도 뛰어난 성능을 보였다.
  • AlexNet에서는 8비트 가중치와 4비트 특징맵을 사용해 56.2%의 Top-1 정확도를 달성하였으며, 부동소수점 기준으로 0.6% 이내의 정확도를 유지했다.
  • VGG-16에서는 8비트 가중치와 4비트 특징맵을 사용해 68.3%의 Top-1 정확도를 기록하였으며, 부동소수점 기준과 동일한 성능을 달성했다.
  • BFT 튜닝 단계는 기준 양자화 대비 최대 1.9%의 정확도 향상을 이끌어내어 SQNR-정확도 격차를 메우는 데 효과적임을 입증했다.
  • 6비트 및 8비트 정밀도에서 Ristretto 및 QNN보다 정확도 손실가 낮았으며, 8비트 가중치와 4비트 특징맵 조합에서 오직 0.3%의 손실만 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.