Skip to main content
QUICK REVIEW

[논문 리뷰] Focused Quantization for Sparse CNNs

Yiren Zhao, Xitong Gao|arXiv (Cornell University)|2019. 01. 01.
Advanced Neural Network Applications인용 수 11
한 줄 요약

이 논문은 정밀 미세 조정 후 비균형적인 가중치 분포로 인해 기존의 균일하거나 로그 스케일링 양자화가 비효율적인 스파arsity가 있는 컨volutional 신경망(CNN)에 적합한 하이브리드 양자화 방법인 집중적 양자화(Focused Quantization, FQ)를 제안한다. FQ는 층 별 가중치 분포의 통계적 특성을 활용하여 동적으로 시프트 양자화와 재중앙화 양자화를 조합한다. 이로 인해 ResNet-50에서 18.08×의 높은 압축 비율을 달성하면서도 정확도 손실이 극도로 적은 0.24%의 top-5 정확도 감소를 보이며, 추론 과정에서 비트 시프트 연산과 하드웨어 자원 소비를 줄여 효율적인 구현을 가능하게 한다.

ABSTRACT

Deep convolutional neural networks (CNNs) are powerful tools for a wide range of vision tasks, but the enormous amount of memory and compute resources required by CNNs pose a challenge in deploying them on constrained devices. Existing compression techniques, while excelling at reducing model sizes, struggle to be computationally friendly. In this paper, we attend to the statistical properties of sparse CNNs and present focused quantization, a novel quantization strategy based on power-of-two values, which exploits the weight distributions after fine-grained pruning. The proposed method dynamically discovers the most effective numerical representation for weights in layers with varying sparsities, significantly reducing model sizes. Multiplications in quantized CNNs are replaced with much cheaper bit-shift operations for efficient inference. Coupled with lossless encoding, we built a compression pipeline that provides CNNs with high compression ratios (CR), low computation cost and minimal loss in accuracy. In ResNet-50, we achieved a 18.08x CR with only 0.24% loss in top-5 accuracy, outperforming existing compression methods. We fully compressed a ResNet-18 and found that it is not only higher in CR and top-5 accuracy, but also more hardware efficient as it requires fewer logic gates to implement when compared to other state-of-the-art quantization methods assuming the same throughput.

연구 동기 및 목표

  • 정밀한 미세 조정 후 비균형적인 가중치 분포로 인해 표준 양자화 방법이 비효율적인 스파arsity가 있는 CNN에서 균일하거나 로그 스케일링 양자화 수준이 낭비되는 문제를 해결하기 위해.
  • 층 간의 다양한 스파arsity 수준에 적응할 수 있는 양자화 전략을 개발하여, 양자화 수준의 활용도를 극대화하고 계산 오버헤드를 최소화하기 위해.
  • 높은 압축 비율과 낮은 하드웨어 비용을 달성하기 위해 미세 조정, 집중적 양자화, 손실 없는 인코딩을 통합한 완전한 압축 파이프라인을 구축하기 위해.
  • FQ가 최신 기술보다 더 효율적인 하드웨어 구현을 가능하게 하며, 더 적은 논리 게이트와 낮은 자원 사용량을 요구함을 입증하기 위해.

제안 방법

  • FQ는 정련된 층의 가중치 분포에서 고확률 영역을 식별하기 위해 혼합 가우시안 모델을 사용하여 타겟팅된 양자화를 가능하게 한다.
  • 다중 집중된 가중치 클러스터가 존재하는 층에 대해서는 재중앙화 양자화를 적용하여 각 클러스터를 2의 거듭제곱 값 집합으로 매핑함으로써 세밀한 표현을 가능하게 한다.
  • 단일 주요 가중치 클러스터가 존재하는 층에 대해서는 2의 거듭제곱 값으로 구성된 시프트 양자화를 적용하여 추론 시 효율적인 비트 시프트 연산을 가능하게 한다.
  • 각 층에 대해 재중앙화 양자화와 시프트 양자화 중 어떤 것을 사용할지 결정하기 위해 가우시안 성분 간의 워샤프스타인 거리 메트릭을 사용하며, 실험에서 임계값 wsep = 2.0을 적용한다.
  • 추론 과정에서 스케일링 인자를 배치 정규화 층에 융합하여 추가적인 곱셈 연산을 제거하고 하드웨어 복잡도를 감소시킨다.
  • 전체 파이프라인은 정밀한 미세 조정, FQ, 그리고 허프만 인코딩을 포함하여 정확도 저하를 최소화하면서도 높은 압축 비율을 달성한다.

실험 결과

연구 질문

  • RQ1정밀한 미세 조정 후 비균형적이고 비균일한 가중치 분포를 가진 스파arsity가 있는 CNN에서 양자화를 어떻게 더 효과적으로 구현할 수 있는가?
  • RQ2시프트 양자화와 재중앙화 양자화를 융합한 하이브리드 양자화 전략이 기존의 표준 양자화 방법보다 압축 효율성과 하드웨어 비용 측면에서 뛰어나게 작용할 수 있는가?
  • RQ3층 별 스파arsity와 가중치 분포에 기반하여 시프트 양자화와 재중앙화 양자화 사이를 전환할 수 있는 신뢰할 수 있는 메트릭은 무엇인가?
  • RQ4집중적 양자화는 현대적인 CNN에서 모델 크기와 계산 비용을 얼마나 줄일 수 있으며, 동시에 정확도를 유지할 수 있는가?
  • RQ5FQ 기반 하드웨어 설계는 최신 기술의 양자화 방법과 비교해 볼 때 논리 게이트 사용량과 자원 효율성 측면에서 어떻게 비교되는가?

주요 결과

  • ResNet-50에서 집중적 양자화는 18.08×의 압축 비율을 달성하면서도 top-5 정확도가 0.24% 뿐만 감소하여 기존 방법들을 능가했다.
  • FQ를 사용한 완전한 양자화된 ResNet-18 모델은 LQ-Net과 ABC-Net보다 더 높은 압축 비율과 더 나은 top-5 정확도를 확보하면서도 더 적은 논리 게이트를 요구했다.
  • FQ 기반 하드웨어 가속기에서는 더 많은 양자화 수준과 더 높은 압축 비율에도 불구하고, ABC-Net과 LQ-Net보다 더 적은 논리 게이트를 사용하여 뛰어난 하드웨어 효율성을 보였다.
  • 워샤프스타인 거리 임계값(wsep = 2.0)을 사용함으로써 재중앙화 양자화와 시프트 양자화가 필요한 층을 효과적으로 구분하였고, 이는 양자화 활용도를 향상시켰다.
  • 미세 조정, 양자화, 허프만 인코딩을 포함한 FQ 파이프라인은 정확도 저하를 최소화하면서도 높은 압축 비율을 달성하여 엣지 및 IoT 기기용으로 적합한 솔루션을 제공했다.
  • FQ가 오직 2의 거듭제곱 값만을 사용함으로써 효율적인 비트 시프트 연산이 가능해져 추론 시 계산 비용을 크게 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.