Skip to main content
QUICK REVIEW

[논문 리뷰] Learning low-precision neural networks without Straight-Through Estimator(STE)

Zhigang Liu, Matthew Mattina|arXiv (Cornell University)|2019. 03. 04.
Advanced Neural Network Applications참고 문헌 8인용 수 5
한 줄 요약

이 논문은 직렬 통과 추정기(Straight-Through Estimator, STE)에 의존하지 않고 저정밀도 신경망을 훈련시키는 새로운 방법인 알파 블렌딩(AB)을 제안한다. AB는 손실 함수 내에서 양자화된 가중치를 정밀도가 높은 가중치와 양자화된 가중치의 애핀 조합으로 대체하며, 혼합 계수 α를 0에서 1로 점진적으로 증가시켜 전체 정밀도 경로를 통해 안정적인 기울기 흐름을 가능하게 한다. 이 방법은 기존의 STE 기반 양자화 기법보다 4비트 가중치 및 8비트 활성화를 갖는 ImageNet 모델에서 상위 1위 정확도를 평균 2.93% 향상시켜 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

The Straight-Through Estimator (STE) is widely used for back-propagating gradients through the quantization function, but the STE technique lacks a complete theoretical understanding. We propose an alternative methodology called alpha-blending (AB), which quantizes neural networks to low-precision using stochastic gradient descent (SGD). Our method (AB) avoids STE approximation by replacing the quantized weight in the loss function by an affine combination of the quantized weight w_q and the corresponding full-precision weight w with non-trainable scalar coefficient $α$ and $1-α$. During training, $α$ is gradually increased from 0 to 1; the gradient updates to the weights are through the full-precision term, $(1-α)w$, of the affine combination; the model is converted from full-precision to low-precision progressively. To evaluate the method, a 1-bit BinaryNet on CIFAR10 dataset and 8-bits, 4-bits MobileNet v1, ResNet_50 v1/2 on ImageNet dataset are trained using the alpha-blending approach, and the evaluation indicates that AB improves top-1 accuracy by 0.9%, 0.82% and 2.93% respectively compared to the results of STE based quantization.

연구 동기 및 목표

  • 양자화된 신경망에서 기울기 역전파에 대한 직렬 통과 추정기(Straight-Through Estimator, STE)의 이론적 기반 부족 문제를 해결하기 위해.
  • 양자화 중에 전체 정밀도 가중치를 통해 안정적인 기울기 갱신을 가능하게 하여 STE의 경험적 근사치를 피하는 훈련 방법론을 개발하기 위해.
  • 1비트 BinaryNet 및 4비트/8비트 MobileNet과 ResNet 아키텍처를 포함한 저정밀도 모델에 대해 제안된 방법의 효과성을 평가하기 위해.
  • 알파 블렌딩이 최신 기술 수준의 STE 기반 양자화 기법보다 높은 추론 정확도를 달성할 수 있음을 입증하기 위해.

제안 방법

  • 손실 함수 내에서 양자화된 가중치 wq를 애핀 조합으로 대체한다: w_ab = (1 - α)w + αwq, 여기서 w는 전체 정밀도 가중치이고 α는 학습되지 않는 스칼라이다.
  • 훈련 중에 α를 0.0에서 1.0으로 점진적으로 증가시켜 모델이 전체 정밀도에서 저정밀도 동작으로 점차 이동하도록 한다.
  • 기울기 갱신을 전체 정밀도 성분 (1 - α)w에 대해 수행하여 역전파 중에 미분 가능한 경로를 통해 기울기가 흐르도록 보장한다.
  • 각 레이어 또는 채널 기반의 양자화 전략을 사용하여 AB를 다양한 네트워크 구성 요소(가중치 및 활성화)에 적용한다.
  • 수정된 손실 함수를 사용하여 확률적 경사 하강법(SGD)으로 모델을 훈련시키며, 전체 정밀도 가중치를 훈련 가능한 파라미터로 유지한다.
  • 훈련 후 최종 모델을 저정밀도 추론 형식으로 변환하며, 최종 α = 1.0 기반으로 가중치와 활성화를 양자화한다.

실험 결과

연구 질문

  • RQ1STE를 사용하지 않으면서도 양자화 정확도를 유지하거나 향상시킬 수 있는 훈련 방법을 설계할 수 있는가?
  • RQ2전체 정밀도 가중치와 양자화된 가중치를 점진적으로 혼합하는 것이 저정밀도 네트워크에서 안정적이고 효과적인 역전파를 가능하게 하는가?
  • RQ3CIFAR10 및 ImageNet과 같은 표준 벤치마크에서 알파 블렌딩은 STE 기반 양자화와 비교해 상위 1위 정확도에서 어떻게 성능을 내는가?
  • RQ4AB는 STE에 의존하지 않고 혼합 정밀도 양자화(예: 4비트 가중치 및 8비트 활성화)에서도 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • 1비트 BinaryNet에 대해 CIFAR10에서 알파 블렌딩은 STE 기반 양자화보다 상위 1위 정확도를 0.9% 향상시켰다.
  • 8비트 가중치 및 8비트 활성화 양자화에서 AB는 ImageNet에서 최신 기술 수준의 STE 기반 방법보다 상위 1위 정확도가 0.82% 높았다.
  • 4비트 가중치 및 8비트 활성화 모델에서 AB는 MobileNet과 ResNet 아키텍처 평균적으로 이전 연구 대비 상위 1위 정확도를 2.93% 향상시켰다.
  • AB의 4비트 가중치 및 4비트 활성화 양자화는 최고 성능의 4비트 가중치 및 8비트 활성화 방법과 유사한 정확도를 달성하여 혼합 정밀도 환경에서의 효과성을 입증했다.
  • AB의 채널 기반 양자화 변종은 4비트 가중치 및 8비트 활성화에서 평균 0.9% 정확도 손실을 기록했으며, 이는 이전 결과보다 2.93% 우수한 성능을 기록했다.
  • 비차별 가능한 양자화 함수가 존재하는 상황에서도 이 방법은 저정밀도 모델의 훈련을 성공적으로 가능하게 하여 기울기 소실 문제를 해결했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.