Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Neural Network Compression with Single and Multiple Level Quantization

Yuhui Xu, Yongzhuang Wang|arXiv (Cornell University)|2018. 03. 06.
Advanced Image and Video Retrieval Techniques인용 수 43
한 줄 요약

이 논문은 고비트 양자화를 위한 단일 수준 양자화(SLQ)와 극저비트(삼진 양자화)용 다중 수준 양자화(MLQ)를 도입하며, 너비(width)와 깊이(depth) 분할을 활용해 정확도 손실을 최소화하면서 모델 크기를 줄인다.

ABSTRACT

Network quantization is an effective solution to compress deep neural networks for practical usage. Existing network quantization methods cannot sufficiently exploit the depth information to generate low-bit compressed network. In this paper, we propose two novel network quantization approaches, single-level network quantization (SLQ) for high-bit quantization and multi-level network quantization (MLQ) for extremely low-bit quantization (ternary).We are the first to consider the network quantization from both width and depth level. In the width level, parameters are divided into two parts: one for quantization and the other for re-training to eliminate the quantization loss. SLQ leverages the distribution of the parameters to improve the width level. In the depth level, we introduce incremental layer compensation to quantize layers iteratively which decreases the quantization loss in each iteration. The proposed approaches are validated with extensive experiments based on the state-of-the-art neural networks including AlexNet, VGG-16, GoogleNet and ResNet-18. Both SLQ and MLQ achieve impressive results.

연구 동기 및 목표

  • 매개변수 수가 많고 자원 제약 기기에 배포되는 상황에서 효율적인 DNN 압축의 필요성을 제시한다.
  • 가중치 분포와 계층별 중요도를 고려하는 두 가지 양자화 전략(SLQ 및 MLQ)을 제안한다.
  • 클러스터링, 손실 기반 분할, 가중치 공유 및 재학습을 포함한 실용적 프레임워크를 개발한다.
  • 표준 아키텍처(AlexNet, VGG-16, GoogleNet, ResNet-18)와 데이터셋(ImageNet, CIFAR-10)에서의 효과를 입증한다.

제안 방법

  • 가중치를 위한 코드북을 형성하기 위해 계층별 k-means 클러스터링을 사용한다.
  • 클러스터를 양자화 및 재학습 그룹으로 분할하는 손실 기반 파티션을 적용한다.
  • 선택된 그룹을 클러스터 중심값에 가중치를 할당하여 양자화하고 나머지 가중치를 재학습한다.
  • 모든 가중치가 양자화될 때까지 클러스터링, 분할, 양자화 및 재학습을 반복한다.
  • ESLQ를 도입하여 중심값을 특정 값 유형(예를 들면 2의 거듭제곱)에 가깝게 제약한다.
  • MLQ에서 레이어 보상(ILC, incremental layer compensation)을 도입해 손실이 큰 레이어를 먼저 양자화하고 나머지를 다듬어 3진 양자화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1가중치 분포 인식 양자화(클러스터링 및 손실 기반 분할)를 통해 고비트 폭(예: 5비트)에서 정확도를 유지할 수 있는가?
  • RQ2깊이 인식 전략(ILC)이 네트워크 아키텍처를 변경하지 않고도 극저비트(삼진) 양자화를 신뢰할 수 있게 가능하게 하는가?
  • RQ3계층별 및 중앙 제약을 포함하는 것이 여러 아키텍처(AlexNet, VGG-16, GoogleNet, ResNet-18)에서 양자화 성능을 향상시키는가?
  • RQ4SLQ와 MLQ가 ImageNet 및 CIFAR-10과 같은 벤치마크에서 기존 양자화 방법(INQ, TWN, TTQ 등)과 비교하여 어떤 차이를 보이는가?

주요 결과

  • ImageNet 유도 네트워크(VGG-16 등)에서 5-bit SLQ가 풀 프리시전 참조보다 특정 경우에 더 높은 Top-1/Top-5 정확도를 달성한다.
  • ImageNet에서 5-bit SLQ는 여러 네트워크에서 INQ보다 개선을 보이며(예: VGG-16: Top-1 72.23% vs 68.54% 참조; Top-5 91.0% vs 88.65%)
  • 4-bit SLQ 및 3-bit SLQ 결과는 중심값 수에 따라 정확도가 유지되거나 약간 저하됨(예: VGG-16 4-bit: Top-1 71.18%, Top-5 90.25%)
  • MLQ는 CIFAR-10에서 삼진 양자화를 최소한의 정확도 손실로 가능하게 한다(가벼운 CNN: Top-1 78.46% vs 78.66%; ResNet20: Top-1 90.02% vs 91.70%); ImageNet의 AlexNet은 BN 계층 추가 없이도 유사한 결과를 달성한다.
  • BN 없이 ImageNet에서 MLQ가 Top-1 54.24%, Top-5 77.78%를 달성하여 BN 계층 없이도 구조 변경 없이 경쟁력 있는 성능을 보여준다.
  • 5-bit AlexNet에서 SLQ는 약 6배의 압축을 달성하며, 가지치기와 결합 시 정확도 손실 없이 약 53배까지 달성 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.