Skip to main content
QUICK REVIEW

[논문 리뷰] Learnable Companding Quantization for Accurate Low-bit Neural Networks

Kohei Yamamoto|arXiv (Cornell University)|2021. 03. 12.
Advanced Neural Network Applications참고 문헌 28인용 수 4
한 줄 요약

이 논문은 2-, 3-, 4비트 신경망에서 양자화 오차를 최소화하기 위해 학습 가능한 압축 함수와 클리핑 파ameters를 함께 최적화하는 새로운 비균일 양자화 방법인 학습 가능한 컴프랜딩 양자화(LCQ)를 제안한다. LCQ는 상태기반 정확도를 달성하며, ImageNet에서 2비트 ResNet-50 모델이 상위 1위 정확도 75.1%를 기록하여 전체 정밀도 모델과의 정확도 격차를 단 1.7%로 줄였다.

ABSTRACT

Quantizing deep neural networks is an effective method for reducing memory consumption and improving inference speed, and is thus useful for implementation in resource-constrained devices. However, it is still hard for extremely low-bit models to achieve accuracy comparable with that of full-precision models. To address this issue, we propose learnable companding quantization (LCQ) as a novel non-uniform quantization method for 2-, 3-, and 4-bit models. LCQ jointly optimizes model weights and learnable companding functions that can flexibly and non-uniformly control the quantization levels of weights and activations. We also present a new weight normalization technique that allows more stable training for quantization. Experimental results show that LCQ outperforms conventional state-of-the-art methods and narrows the gap between quantized and full-precision models for image classification and object detection tasks. Notably, the 2-bit ResNet-50 model on ImageNet achieves top-1 accuracy of 75.1% and reduces the gap to 1.7%, allowing LCQ to further exploit the potential of non-uniform quantization.

연구 동기 및 목표

  • 완전 정밀도 모델 대비 극히 저비트(2-, 3-, 4비트) 신경망에서 발생하는 심각한 정확도 저하 문제를 해결하기 위해.
  • 학습 가능한 압축 함수를 통해 민감한 비균일 양자화 수준 제어를 가능하게 하여 양자화 정확도를 향상시키기 위해.
  • 새로운 가중치 정규화 기법을 사용하여 양자화된 네트워크의 학습을 안정화시키기 위해.
  • 성능을 훼손하지 않으면서도 추론 시 메모리 오버헤드를 줄이기 위해 룩업 테이블(LUT) 크기를 최적화하기 위해.

제안 방법

  • LCQ는 비선형적으로 가중치와 활성화 값을 압축하고 복원할 수 있도록 학습 가능한 조각별 선형 압축 함수를 정의하여 비균일 양자화를 가능하게 한다.
  • 압축 함수는 직선 통과 추정기(STE)를 사용한 역전파를 통해 클리핑 임계값과 네트워크 가중치와 함께 공동 최적화된다.
  • 양자화된 가중치의 표준편차를 복원하여 학습 안정성과 정확도를 향상시키기 위해 새로운 정규화 기법인 제한된 가중치 정규화(LWN)를 도입한다.
  • 외부 비트 폭을 줄이기 위한 재양자화 기법을 사용하여 LUT의 메모리 비용을 최소화하고 효율적인 추론을 실현한다.
  • 압축 함수는 학습 가능한 매개변수 Θ로 파arameter화되어 있어 데이터 분포에 따라 민감하고 적응적인 양자화 수준 분포를 가능하게 한다.
  • 클리핑, 압축, 반올림, 복원의 복합 함수를 통합하며, 비선형 압축 및 복원 성분이 함께 훈련된다.

실험 결과

연구 질문

  • RQ1학습 가능한 비균일 양자화가 이미지 분류 및 객체 검출 작업에서 저비트 모델과 전체 정밀도 모델 간의 정확도 격차를 크게 줄일 수 있는가?
  • RQ2학습 가능한 압축 함수의 간격 수가 저비트 네트워크 성능에 어떤 영향을 미치는가?
  • RQ3제한된 가중치 정규화(LWN)가 양자화된 네트워크에서 학습 안정성과 정확도를 얼마나 향상시키는가?
  • RQ4LUT의 외부 비트 폭을 줄여도 높은 모델 정확도를 유지하면서 추론에 대한 메모리 오버헤드를 줄일 수 있는가?
  • RQ5다양한 아키텍처와 데이터셋에서 기존의 균일 및 비균일 양자화 방법과 비교해 LCQ는 정확도와 효율성 측면에서 어떤가?

주요 결과

  • ImageNet에서 2비트 ResNet-50 모델이 상위 1위 정확도 75.1%를 기록하여 전체 정밀도 모델과의 정확도 격차를 단 1.7%로 줄였다.
  • LCQ는 CIFAR-10/100, ImageNet, COCO 데이터셋에서 이미지 분류 및 객체 검출 작업 모두에서 최신 기술을 초월했다.
  • 압축 함수의 간격 수를 늘릴수록 정확도가 향상되었으며, 특히 저비트 폭에서 두드러진 성능 향상으로 민감성과 성능 향상 간의 강력한 연관성을 보였다.
  • 제한된 가중치 정규화(LWN)는 2비트 양자화에서 뚜렷한 정확도 향상을 가져왔고, 3-4비트 수준에서는 소량의 성능 향상이 있었으며 학습 안정성을 향상시켰다.
  • LUT의 외부 비트 폭을 8비트에서 4비트로 줄여도 CIFAR-10 및 ImageNet에서 정확도 저하가 0.2% 이내로 유지되었으며, LUT 메모리 비용은 반으로 줄었다.
  • COCO 객체 검출에서 LCQ는 비균일 방법인 APoT와 비교해 유사하거나 뛰어난 평균 정밀도(AP)를 달성하여 다양한 작업에 대한 강력한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.