Skip to main content
QUICK REVIEW

[논문 리뷰] Weight Normalization based Quantization for Deep Neural Network Compression

Wen-Pu Cai, Wu-Jun Li|arXiv (Cornell University)|2019. 07. 01.
Advanced Neural Network Applications참고 문헌 36인용 수 10
한 줄 요약

이 논문은 깊이 신경망의 가중치 분포에서 발생하는 긴 尾(長尾) 분포 문제를 완화하기 위해 가중치 정규화를 적용하는 새로운 방법인 가중치 정규화 기반 양자화(WNQ)를 제안한다. 이로 인해 양자화 오차가 감소하며, CIFAR-100 및 ImageNet에서 기존 방법들인 LQ-Net과 QIL보다 우수한 성능을 기록한다. 특히 2비트 및 3비트 양자화와 같은 저비트 폭에서 상당한 상대 평균 제곱 오차를 감소시켜 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

With the development of deep neural networks, the size of network models becomes larger and larger. Model compression has become an urgent need for deploying these network models to mobile or embedded devices. Model quantization is a representative model compression technique. Although a lot of quantization methods have been proposed, many of them suffer from a high quantization error caused by a long-tail distribution of network weights. In this paper, we propose a novel quantization method, called weight normalization based quantization (WNQ), for model compression. WNQ adopts weight normalization to avoid the long-tail distribution of network weights and subsequently reduces the quantization error. Experiments on CIFAR-100 and ImageNet show that WNQ can outperform other baselines to achieve state-of-the-art performance.

연구 동기 및 목표

  • 저비트 DNN 양자화에서 긴 尾 분포로 인한 높은 양자화 오차를 해결하기 위해.
  • 가중치 정규화를 통해 양자화 오차를 최소화하여 모델 압축 성능을 향상시키기 위해.
  • 기존에 거의 탐색되지 않은 요소인 가중치 분포가 양자화 정확도에 미치는 영향을 탐구하기 위해.
  • 모델 정확도를 희생시키지 않고 저비트 가중치 양자화에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • WNQ는 양자화 이전에 각 필터에 대해 가중치 정규화를 적용하여 긴 尾 영향을 감소시키는 방식이다.
  • 층 단위가 아닌 필터 단위로 가중치를 양자화함으로써 더 정밀하고 안정적인 양자화를 가능하게 한다.
  • 학습된 스케일 및 시프트 파rameter를 사용하는 표준 양자화 함수를 사용하며, 스케일은 정규화된 가중치의 L2 노름에서 유도된다.
  • 가중치 정규화는 학습 중에 적용되며, 추론 시에는 양자화된 가중치를 사용하여 정확도 저하를 최소화한다.
  • 기존의 양자화 프레임워크와 호환되며, 활성화 양자화와도 조합 가능하다.
  • 분포 안정성 비교를 위해 상대 평균 제곱 양자화 오차(mse)를 메트릭으로 사용하여 평가한다.

실험 결과

연구 질문

  • RQ1저비트 DNN에서 네트워크 가중치의 긴 尾 분포가 양자화 오차에 어떤 영향을 미치는가?
  • RQ2가중치 정규화를 통해 가중치 분포를 매끄럽게 함으로써 양자화 오차를 효과적으로 감소시킬 수 있는가?
  • RQ3LQ-Net과 QIL과 같은 기존 최신 기술 수준의 양자화 방법보다 WNQ가 저비트 환경에서 더 우수한 성능을 보일 수 있는가?
  • RQ4첫 번째 및 마지막 층을 포함한 모든 층을 양자화할 때 WNQ는 높은 정확도를 유지할 수 있는가? 이는 이전 방법들이 종종 이러한 층을 제외하기 때문이다.
  • RQ5다른 층에서 상대 평균 제곱 양자화 오차에 가중치 분포가 미치는 영향은 어떠한가?

주요 결과

  • 3비트 양자화에서 ImageNet에서 WNQ는 0.24의 Top1-gap을 기록하여 LQ-Net(0.38 gap)과 QIL(0.30 gap)을 모두 앞서며, 모든 층을 양자화한 상태에서 성능을 확보했다.
  • CIFAR-100에서 WNQ는 3비트 양자화 시 Top1-gap을 0.39로 줄였고, LQ-Net의 0.66과 비교해 양자화 오차가 낮음을 시사한다.
  • ImageNet의 ResNet18에서 WNQ는 2비트에서 0.03의 Top1-gap을 기록하여 LQ-Net의 0.28 gap보다 뚜렷이 우수하다.
  • 완전 연결 층에서 상대 평균 제곱 양자화 오차(mse)는 WNQ가 LQ-Net보다 5.29배 낮아, 양자화 오차 감소를 확인한다.
  • 특히 마지막 층에서 WNQ의 가중치 분포는 LQ-Net보다 더 매끄럽고 긴 尾가 적어 성능 향상과 상관관계가 있다.
  • MobileNetv1에서 WNQ는 2비트일 경우 1.24% 향상, 3비트일 경우 2.06% 향상되어 다양한 아키텍처에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.