Skip to main content
QUICK REVIEW

[논문 리뷰] Nonuniform-to-Uniform Quantization: Towards Accurate Quantization via Generalized Straight-Through Estimation

Zechun Liu, Kwang‐Ting Cheng|arXiv (Cornell University)|2021. 11. 29.
Advanced Neural Network Applications참고 문헌 32인용 수 6
한 줄 요약

이 논문은 비균일 입력 임계값을 학습하는 유연한 방법을 제공하는 새로운 양자화 기법인 비균일에서 균일로의 양자화(N2UQ)를 제안한다. 이는 균일 양자화의 하드웨어 효율성을 유지하면서도 비균일 양자화 수준의 높은 정확도를 달성한다. 일반화된 직행 추정기(G-STE)를 도입하여 비균일 임계값을 통한 기울기 역전파와 엔트로피 보존 정규화를 실현하였으며, ImageNet에서 2-bit ResNet-50을 사용해 최상위 1위 정확도 69.7%를 달성하여 전체 정밀도 모델보다 0.6% 이하의 오차를 기록하였다.

ABSTRACT

The nonuniform quantization strategy for compressing neural networks usually achieves better performance than its counterpart, i.e., uniform strategy, due to its superior representational capacity. However, many nonuniform quantization methods overlook the complicated projection process in implementing the nonuniformly quantized weights/activations, which incurs non-negligible time and space overhead in hardware deployment. In this study, we propose Nonuniform-to-Uniform Quantization (N2UQ), a method that can maintain the strong representation ability of nonuniform methods while being hardware-friendly and efficient as the uniform quantization for model inference. We achieve this through learning the flexible in-equidistant input thresholds to better fit the underlying distribution while quantizing these real-valued inputs into equidistant output levels. To train the quantized network with learnable input thresholds, we introduce a generalized straight-through estimator (G-STE) for intractable backward derivative calculation w.r.t. threshold parameters. Additionally, we consider entropy preserving regularization to further reduce information loss in weight quantization. Even under this adverse constraint of imposing uniformly quantized weights and activations, our N2UQ outperforms state-of-the-art nonuniform quantization methods by 0.5~1.7 on ImageNet, demonstrating the contribution of N2UQ design. Code and models are available at: https://github.com/liuzechun/Nonuniform-to-Uniform-Quantization.

연구 동기 및 목표

  • 비균일 양자화와 균일 양자화 간의 성능 격차를 해소하기 위해 유연한 입력 임계값 학습을 가능하게 하면서도 균일 출력 수준을 유지한다.
  • 균일 양자화기에서 비균일 입력 임계값을 학습하기 위한 기울기 문제를 해결한다.
  • 엔트로피 보존 정규화를 통해 저비트 DNN에서의 양자화 오차와 정보 손실을 줄인다.
  • 비균일 출력을 위한 후처리를 피하고 직접 비트 연산을 가능하게 하여 하드웨어 효율성을 유지한다.

제안 방법

  • 비균일 입력 임계값을 학습하면서도 균일한 간격의 출력 수준을 생성하는 비균일에서 균일로의 양자화기(N2UQ)를 제안한다.
  • 스토캐스틱 양자화에서 유도된 일반화된 직행 추정기(G-STE)를 도입하여 비균일 임계값을 통한 기울기 흐름을 가능하게 한다.
  • G-STE에서 기대치 기반의 역전파 근사법을 사용하여 임계값 파라미터에 대한 비가역 기울기를 처리한다.
  • 기본적인 가중치 분포에 적응함으로써 가중치 양자화 중 정보 손실을 최소화하기 위해 엔트로피 보존 정규화를 적용한다.
  • 학습된 임계값에 기반해 실수 입력을 균일 출력 수준으로 매핑하는 미분 가능한 양자화 함수를 사용한다.
  • G-STE와 정규화를 사용하여 백프로파게이션을 통해 전체 네트워크를 종단 간 최적화하여 임계값과 가중치를 함께 최적화한다.

실험 결과

연구 질문

  • RQ1비균일 양자화의 표현 능력을 갖추면서도 균일 양자화와 같은 하드웨어 효율성을 유지할 수 있는 양자화 방법은 가능한가?
  • RQ2균일 양자화 프레임워크 내에서 학습 가능한 비균일 입력 임계값을 통해 효과적으로 기울기를 역전파할 수 있는가?
  • RQ3저비트 가중치 양자화 중 정보를 가장 잘 보존하는 정규화 전략은 무엇인가?
  • RQ4학습 가능한 임계값과 엔트로피 인식 정규화를 통합한 통합 훈련 프레임워크는 기존의 비균일 양자화 방법을 초월할 수 있는가?

주요 결과

  • 2-bit로 양자화된 ResNet-18을 사용한 N2UQ는 ImageNet에서 최상위 1위 정확도 69.7%를 달성하여 전체 정밀도 모델과의 격차를 2.1%로 좁혔다.
  • 2-bit N2UQ ResNet-50는 최상위 1위 정확도 67.1%를 기록하여 전체 정밀도 모델보다 0.6% 이하의 오차를 보였다.
  • 제안된 G-STE 방법은 비균일 입력 임계값의 효과적인 훈련을 가능하게 하여 기준 균일 양자화 방법 대비 정확도를 3.0% 향상시켰다.
  • 엔트로피 보존 가중치 정규화는 기준 모델 대비 정확도를 1.9% 향상시켰으며, 가중치 노름 및 학습 가능한 스케일링 인자 기반 기준 모델을 모두 능가했다.
  • 제거 실험 결과, 임계값 학습과 엔트로피 정규화 모두 필수적임을 확인하였으며, 이들의 조합이 가장 높은 성능을 기록했다.
  • 학습된 임계값은 데이터 분포에 적응하여 고밀도 영역에서는 작은 간격, 희소 尾영역에서는 큰 간격을 가지며, 이로 인해 양자화 오차가 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.