Skip to main content
QUICK REVIEW

[논문 리뷰] SDQ: Stochastic Differentiable Quantization with Mixed Precision

Xijie Huang, Zhiqiang Shen|arXiv (Cornell University)|2022. 06. 09.
Image Enhancement Techniques인용 수 8
한 줄 요약

SDQ는 다양한 비트폭 파라미터(가능성 요소)와 구름-소프트맥스 재정의를 사용하여 신경망 레이어 간 최적의 혼합 정밀도 비트폭 할당을 자동으로 학습하는 확률적 미분 가능 양자화 방법을 제안한다. 이는 부드럽고 전역 최적화된 훈련을 가능하게 하며, ResNet과 MobileNet에서 평균 비트폭이 4비트 이하일 때 최신 기술 수준의 정확도를 달성한다. 이는 GPU 및 FPGA에서 뛰어난 하드웨어 효율성을 보여준다.

ABSTRACT

In order to deploy deep models in a computationally efficient manner, model quantization approaches have been frequently used. In addition, as new hardware that supports mixed bitwidth arithmetic operations, recent research on mixed precision quantization (MPQ) begins to fully leverage the capacity of representation by searching optimized bitwidths for different layers and modules in a network. However, previous studies mainly search the MPQ strategy in a costly scheme using reinforcement learning, neural architecture search, etc., or simply utilize partial prior knowledge for bitwidth assignment, which might be biased and sub-optimal. In this work, we present a novel Stochastic Differentiable Quantization (SDQ) method that can automatically learn the MPQ strategy in a more flexible and globally-optimized space with smoother gradient approximation. Particularly, Differentiable Bitwidth Parameters (DBPs) are employed as the probability factors in stochastic quantization between adjacent bitwidth choices. After the optimal MPQ strategy is acquired, we further train our network with entropy-aware bin regularization and knowledge distillation. We extensively evaluate our method for several networks on different hardware (GPUs and FPGA) and datasets. SDQ outperforms all state-of-the-art mixed or single precision quantization with a lower bitwidth and is even better than the full-precision counterparts across various ResNet and MobileNet families, demonstrating the effectiveness and superiority of our method.

연구 동기 및 목표

  • 기존 혼합 정밀도 양자화(MPQ) 방법이 비용이 많이 들거나 최적화되지 않은 히우리스틱 기반의 비트폭 할당에 의존하는 한계를 해결하기 위해.
  • 모든 레이어에 걸쳐 최적의 비트폭을 종단 간(end-to-end) 학습할 수 있는 미분 가능하고 전역 최적화된 프레임워크를 개발하기 위해.
  • 기울기 역전파 과정에서 선형 보간 대신 확률적 양자화를 도입하여 훈련 안정성과 수렴성을 향상시키기 위해.
  • 엔트로피 인식 정규화와 지식 증류를 통해 양자화 오차를 최소화하고 정보를 담고 있는 구성 요소를 유지하기 위해.
  • 다양한 하드웨어 플랫폼에서 기존의 전정밀도 및 이전의 양자화 모델을 초월하는 고정밀도, 저비트폭 모델을 달성하기 위해.

제안 방법

  • 이웃하는 후보 비트폭 간의 확률적 선택을 나타내는 학습 가능한 가능도 요소로 Differentiable Bitwidth Parameters(DBPs)를 도입한다.
  • 전방 전파에서 각 가중치 또는 활성화는 DBPs로 파arameter화된 이항분포에서 샘플된 비트폭으로 양자화된다.
  • 이산적 비트폭 선택을 통해 미분 가능한 기울기 전파를 가능하게 하기 위해 구름-소프트맥스 재정의를 사용한다.
  • 레이어별 정밀도 요구 사항을 고려하여 정보가 풍부한 가중치 구성 요소를 유지하고 양자화 오차를 줄이기 위해 엔트로피 인식 바이너리 정규화(EBR)를 적용한다.
  • 전정밀도 교사 모델에서 지식 증류를 통합하여 양자화된 학생 네트워크의 표현 능력을 향상시킨다.
  • 표준 기울기 역전파를 사용하여 전체 MPQ 전략을 종단 간 최적화함으로써 모든 레이어에 걸쳐 최적의 비트폭 할당을 한 번에 학습할 수 있다.

실험 결과

연구 질문

  • RQ1기존 강화학습 및 히우리스틱 기반 비트폭 검색에 비해, 미분 가능하고 확률적인 접근 방식이 정확도와 최적화 안정성 측면에서 더 우수한가?
  • RQ2Gumbel-softmax 재정의를 사용한 확률적 양자화가 선형 보간 대비 혼합 정밀도 양자화(MPQ)에서 훈련 안정성과 손실 곡면의 매끄러움을 어떻게 향상시키는가?
  • RQ3엔트로피 인식 정규화와 지식 증류는 저비트폭 환경에서 양자화 오차를 얼마나 줄이고 모델 정확도를 유지하는가?
  • RQ4제안된 SDQ 프레임워크는 ResNet 및 MobileNet과 같은 다양한 아키텍처에서 평균 비트폭이 4비트 이하일 때 최신 기술 수준의 정확도를 달성할 수 있는가?
  • RQ5FPGA와 같은 실제 하드웨어 가속기에서 SDQ는 지연 시간과 에너지 효율 측면에서 어떻게 성능을 발휘하는가?

주요 결과

  • ImageNet-1K에서 ResNet18을 사용한 경우, SDQ는 가중치/활성화의 평균 비트폭이 각각 3.85/2비트일 때 상위 1위 정확도 71.7%를 달성하며, 전정밀도 모델의 70.5%를 초월한다.
  • ImageNet-1K에서 MobileNetV2를 사용한 경우, SDQ는 평균 비트폭이 4.02/3.85일 때 상위 1위 정확도 71.8%를 달성하며, 모든 이전의 단일 및 혼합 정밀도 양자화 방법을 뛰어넘는다.
  • COCO 검출 작업에서 YOLOv4-tiny를 사용한 경우, 평균 비트폭이 3.88/4.00일 때 SDQ는 15.9% mAP를 달성하며, 4비트 균일 양자화를 초월하고 8비트 기준선에 근접하면서도 에너지 소비를 41.5% 감소시킨다.
  • FPGA에 구현된 SDQ 모델은 21.28ms의 지연 시간과 167.1mJ의 에너지 소비를 기록하여, 4비트 균일 양자화 모델과 유사한 하드웨어 효율성을 보여준다.
  • SDQ의 손실 곡면은 선형 보간 기반 방법보다 현저히 매끄럽게 나타나, 더 안정적이고 효과적인 최적화를 가능하게 한다.
  • 엔트로피 인식 바이너리 정규화와 지식 증류의 조합은 특히 저정밀도 환경에서 정보를 담고 있는 구성 요소를 더 잘 유지하고 양자화 오차를 줄이는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.