Skip to main content
QUICK REVIEW

[논문 리뷰] Relaxed Quantization for Discretized Neural Networks

Christos Louizos, Matthias Reisser|UvA-DARE (University of Amsterdam)|2018. 10. 03.
Advanced Neural Network Applications참고 문헌 36인용 수 16
한 줄 요약

이 논문은 이산적 양자화를 연속적인 대체 분포로 완화함으로써, 저비트 신경망의 엔드 투 엔드 학습을 가능하게 하는 미분 가능한 양자화 방법인 Relaxed Quantization(RQ)을 제안한다. 가중치와 활성화를 학습 가능한 양자화 격자 위의 다항분포로 모델링하고, 콘크리트 완화를 사용함으로써 RQ는 기울기 기반 최적화를 허용하며, ImageNet, CIFAR-10, MNIST에서 최고 성능의 정확도-효율성 트레이드오프를 달성한다. 양자화 후 정확도 손실가 최소화된다.

ABSTRACT

Neural network quantization has become an important research area due to its great impact on deployment of large models on resource constrained devices. In order to train networks that can be effectively discretized without loss of performance, we introduce a differentiable quantization procedure. Differentiability can be achieved by transforming continuous distributions over the weights and activations of the network to categorical distributions over the quantization grid. These are subsequently relaxed to continuous surrogates that can allow for efficient gradient-based optimization. We further show that stochastic rounding can be seen as a special case of the proposed approach and that under this formulation the quantization grid itself can also be optimized with gradient descent. We experimentally validate the performance of our method on MNIST, CIFAR 10 and Imagenet classification.

연구 동기 및 목표

  • 양자화의 비미분 가능성으로 인해 기울기 기반 최적화가 제한되는 문제를 해결하기 위해.
  • 기울기 하강법을 사용해 양자화 격자 파rameter(스케일 및 오프셋)와 네트워크 가중치를 함께 최적화할 수 있도록 하기 위해.
  • 스토케스틱 라운딩과 표준 양자화가 특수한 경우로 간주될 수 있는 통합 프레임워크를 제공하기 위해.
  • 실제 양자화 효과를 시뮬레이션하는 완화된, 기울기 기반의 양자화를 통해 양자화 모델의 정확도를 향상시키기 위해.
  • 엔드 투 엔드 학습 가능한 양자화를 통해 자원 제약이 있는 장치에 저정밀도 모델을 효율적으로 구현할 수 있도록 하기 위해.

제안 방법

  • 연속적인 분포를 이산적 양자화 격자 위의 다항분포로 변환한다.
  • 백프로파게이션을 위한 연속적이고 기울기 기반의 대체 분포를 만들기 위해 다항분포의 콘크리트 완화를 도입한다.
  • 양자화 격자는 학습 가능한 스케일과 오프셋으로 매개변수화되어 있어 격자 자체를 기울기 기반 최적화할 수 있다.
  • 완화 온도를 1로 설정했을 때, 이 접근법은 스위치 라운딩을 특수한 경우로 일반화한다.
  • 완화된 대체 분포를 통해 양자화 연산을 통한 기울기 흐름을 허용함으로써 엔드 투 엔드 학습을 지원한다.
  • 저정밀도 하드웨어에서의 실제 배포 조건을 반영하기 위해 훈련 중 배치 정규화를 모방한다.

실험 결과

연구 질문

  • RQ1기존에 사전에 고정된 격자를 대신해, 기울기 하강법을 통해 양자화 격자 자체를 학습시킬 수 있는가?
  • RQ2저비트 네트워크의 엔드 투 엔드 학습을 가능하게 하기 위해, 양자화 연산을 어떻게 기울기 기반으로 만들 수 있는가?
  • RQ3스토케스틱 라운딩은 더 일반적인 기울기 기반 양자화 프레임워크의 특수한 경우인가?
  • RQ4완화된 양자화를 통해 훈련함으로써, 양자화 모델의 정확도-효율성 트레이드오프를 더 좋게 만들 수 있는가?
  • RQ5기존의 양자화 기법과 비교할 때, 제안된 방법은 정확도와 계산 효율성 측면에서 어떻게 성능을 내는가?

주요 결과

  • RQ는 ResNet-18과 MobileNet에서 정확도 대비 BOPs(초당 비트 연산 수) 트레이드오프에서 최고 성능을 달성하며, 파레토 최적 경계를 형성한다.
  • ImageNet에서 RQ는 SR+DR, BWN, XNOR-Net, 그리고 단순 라운딩과 같은 기준 방법들을 능가하며, 특히 저비트 영역(4–5비트)에서 두각을 나타낸다.
  • 8비트 양자화에서 RQ는 Jacob et al. (2017)의 성능을 맞추거나 초월하며, Pre-trained 모델의 성능을 향상시키는 데 성공한다. 반면 Jacob et al.는 약간의 성능 저하를 보였다.
  • 완화 온도를 1로 설정했을 때, 스위치 라운딩이 RQ의 특수한 경우로 나타나며, 이는 하나의 기울기 기반 프레임워크 내에서 통합됨을 보여준다.
  • RQ 없이 단순 라운딩을 사용할 경우, 모든 비트 구성에서 MobileNet에서 거의 무작위 성능을 보이며, 기울기 기반 학습의 필요성을 강조한다.
  • 이 방법은 양자화 격자와 네트워크 가중치를 함께 최적화할 수 있어, 더 강력하고 정확도가 높은 양자화 모델을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.