Skip to main content
QUICK REVIEW

[논문 리뷰] Blended Coarse Gradient Descent for Full Quantization of Deep Neural Networks

Penghang Yin, Shuai Zhang|arXiv (Cornell University)|2018. 08. 15.
Advanced Neural Network Applications참고 문헌 34인용 수 12
한 줄 요약

이 논문은 초저비트 가중치와 활성화를 갖는 완전 양자화된 딥 네ural 네트워크를 훈련시키기 위한 새로운 최적화 방법인 블렌디드 코arse 그라디언트 디센트(BCGD)를 제안한다. 전체 정밀도와 양자화된 가중치를 융합하고 진정한 그라디언트와 정확히 상관관계를 가지는 코어스 그라디언트를 사용함으로써, BCGD는 안정적이고 수렴 가능한 훈련을 가능하게 하며, ResNet-18에서 이진 가중치와 4비트 활성화를 사용할 때 ImageNet에서 64.36%의 top-1 정확도를 달성한다.

ABSTRACT

Quantized deep neural networks (QDNNs) are attractive due to their much lower memory storage and faster inference speed than their regular full precision counterparts. To maintain the same performance level especially at low bit-widths, QDNNs must be retrained. Their training involves piecewise constant activation functions and discrete weights, hence mathematical challenges arise. We introduce the notion of coarse gradient and propose the blended coarse gradient descent (BCGD) algorithm, for training fully quantized neural networks. Coarse gradient is generally not a gradient of any function but an artificial ascent direction. The weight update of BCGD goes by coarse gradient correction of a weighted average of the full precision weights and their quantization (the so-called blending), which yields sufficient descent in the objective value and thus accelerates the training. Our experiments demonstrate that this simple blending technique is very effective for quantization at extremely low bit-width such as binarization. In full quantization of ResNet-18 for ImageNet classification task, BCGD gives 64.36\% top-1 accuracy with binary weights across all layers and 4-bit adaptive activation. If the weights in the first and last layers are kept in full precision, this number increases to 65.46\%. As theoretical justification, we show convergence analysis of coarse gradient descent for a two-linear-layer neural network model with Gaussian input data, and prove that the expected coarse gradient correlates positively with the underlying true gradient.

연구 동기 및 목표

  • 조각별로 일정한 활성화 함수와 이산적 가중치를 갖는 완전 양자화된 신경망 훈련의 과제를 해결하기 위해, 표준 백프로파게이션을 적용할 수 없는 상황을 다루는 것.
  • 양자화된 네트워크에서의 영 또는 근접한 영인 확률적 그라디언트 문제를 해결하기 위해, 진정한 그라디언트가 아닌 비-gradient 기반의 상승 방향인 코어스 그라디언트를 도입하는 것.
  • 양자화된 레이어의 비가역성에도 불구하고 손실 함수의 충분한 감소를 보장하는 훈련 알고리즘을 개발하는 것.
  • 가우시안 입력 가정 하에 진정한 그라디언트와의 정확한 상관관계를 증명함으로써 코어스 그라디언트의 효과성을 이론적으로 정당화하는 것.
  • ImageNet과 같은 표준 벤치마크에서 저비트 양자화, 특히 이진화에서 최신 기술 수준의 성능을 입증하는 것.

제안 방법

  • 진정한 그라디언트에서 유도되지 않은, 비가역적인 양자화된 네트워크의 최적화를 이끄는 인공적 상승 방향인 '코어스 그라디언트'의 개념을 도입한다.
  • 전체 정밀도 가중치와 그들의 양자화된 복제본의 가중 평균에 기반한 가중치 갱신 방식을 사용하는 블렌디드 코어스 그라디언트 디센트(BCGD) 알고리즘을 제안한다.
  • 양자화된 ReLU 활성화 함수에 대해 삼치값 코어스 편도수를 사용하여 양자화 레이어를 통해 백프로파게이션을 가능하게 한다.
  • 거의 곳곳에서 정확한 일반화된 프록시 도함수를 갖는 스트레이트스루 추정기를 적용함으로써, 그라디언트 근사의 안정성을 향상시킨다.
  • 적응형 스텝 사이즈를 갖는 확률적 최적화 프레임워크에 코어스 그라디언트를 통합하여 목적 함수의 단조 감소를 보장한다.
  • 이론적 분석은 가우시안 입력 데이터를 갖는 이중층 신경망 모델에 기반하며, 기대 코어스 그라디언트가 진정한 그라디언트와 정확히 상관관계를 갖는다는 것을 증명한다.

실험 결과

연구 질문

  • RQ1비-gradient 기반의 상승 방향인 코어스 그라디언트가 이산적 가중치와 활성화를 갖는 완전 양자화된 딥 네트워크를 효과적으로 훈련시키는 데 사용될 수 있는가?
  • RQ2BCGD 알고리즘에서 전체 정밀도와 양자화된 가중치를 융합함으로써 훈련 중 손실 함수의 충분한 감소가 보장되는가?
  • RQ3조각별로 일정한 활성화 함수가 존재할 경우, 기대 코어스 그라디언트와 진정한 그라디언트 사이의 상관관계는 어떻게 되는가?
  • RQ4가우시안 입력을 갖는 단순화된 이중층 네트워크에서 BCGD 알고리즘의 이론적 수렴성을 확립할 수 있는가?
  • RQ5기존 방법에 비해 BCGD를 사용할 경우 저비트 양자화(예: 이진화)에서 어떤 성능 향상이 달성되는가?

주요 결과

  • BCGD는 모든 레이어에서 이진 가중치와 4비트 적응형 활성화 양자화를 사용하는 ResNet-18을 사용하여 ImageNet에서 64.36%의 top-1 정확도를 달성한다.
  • 첫 번째 및 마지막 레이어를 전체 정밀도로 유지할 경우, BCGD는 65.46%의 top-1 정확도를 달성하여 혼합 정밀도 미세조정의 유용성을 보여준다.
  • 이론적 분석을 통해 기대 코어스 그라디언트가 진정한 그라디언트와 양의 내적곱을 갖는다는 것을 증명하여 최적화에서 내림방향을 보장한다.
  • 가우시안 입력이 있는 이중층 네트워크에서 코어스 그라디언트가 진정한 그라디언트와 충분히 상관관계가 있음을 입증하여 수렴 보장을 뒷받침한다.
  • BCGD 알고리즘은 적절한 스텝 사이즈 조건 하에서 목적 함수의 단조 감소와 기울기 노름의 0 수렴을 보장한다.
  • 특히 1비트(이진화)와 같은 극단적인 비트 폭에서 표준 백프로파게이션의 안정적이고 효과적인 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.