Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneously Optimizing Weight and Quantizer of Ternary Neural Network using Truncated Gaussian Approximation

Zhezhi He, Deliang Fan|arXiv (Cornell University)|2018. 10. 02.
Advanced Neural Network Applications참고 문헌 20인용 수 8
한 줄 요약

이 논문은 이원화 신경망(TNN) 학습을 위한 새로운 방법을 제안하며, 닫힌 형태의 절단 정규분포 근사법을 사용해 네트워크 가중치와 양자화기 임계값을 동시에 최적화함으로써 엔드 투 엔드 백프로파게이션을 가능하게 한다. 이 방법은 ResNet-50을 사용할 때 ImageNet에서 상위 1위 정확도가 2.16% 감소하는 것으로서 기존의 고정 임계값 TNN보다 뚜렷이 뛰어난 성능을 달성한다.

ABSTRACT

In the past years, Deep convolution neural network has achieved great success in many artificial intelligence applications. However, its enormous model size and massive computation cost have become the main obstacle for deployment of such powerful algorithm in the low power and resource-limited mobile systems. As the countermeasure to this problem, deep neural networks with ternarized weights (i.e. -1, 0, +1) have been widely explored to greatly reduce the model size and computational cost, with limited accuracy degradation. In this work, we propose a novel ternarized neural network training method which simultaneously optimizes both weights and quantizer during training, differentiating from prior works. Instead of fixed and uniform weight ternarization, we are the first to incorporate the thresholds of weight ternarization into a closed-form representation using the truncated Gaussian approximation, enabling simultaneous optimization of weights and quantizer through back-propagation training. With both of the first and last layer ternarized, the experiments on the ImageNet classification task show that our ternarized ResNet-18/34/50 only has 3.9/2.52/2.16% accuracy degradation in comparison to the full-precision counterparts.

연구 동기 및 목표

  • 고정된 최적화되지 않은 양자화기로 인해 발생하는 저비트 양자화된 신경망의 정확도 저하와 느린 수렴 문제를 해결하기 위해.
  • 이원화 함수의 미분 가능 근사를 통해 네트워크 가중치와 양자화 임계값의 엔드 투 엔드 미분 가능한 학습을 가능하게 하기 위해.
  • 직선통과 추정기에서 기울기 정확도 최적화를 도입하여 학습 안정성과 수렴 속도를 향상시키기 위해.
  • ImageNet과 같은 대규모 데이터셋에서 전체 레이어 수준의 이원화를 적용한 이원화 신경망에서 최고 성능을 달성하기 위해.

제안 방법

  • 절단 정규분포 근사를 사용해 이원화 임계값에 대한 닫힌 형태의 표현을 도입하여, 임계값을 백프로파게이션을 통해 미분 가능하고 학습 가능한 것으로 만든다.
  • 레이어 수준의 양자화기 임계값을 네트워크 내에서 학습 가능한 파라미터로 간주하여, 네트워크 가중치 및 스케일링 인자와 함께 공동 최적화할 수 있도록 한다.
  • 백프로파게이션 중 레이어 수준의 스케일링 인자로 인해 발생하는 기울기 스케일링 문제를 수정하기 위해 직선통 추정기에서 기울기 정확도 최적화 방법을 제안한다.
  • 전체 정밀도 사전 학습된 ResNet 아키텍처에 이 방법을 적용하여, 첫 번째 및 마지막 레이어만 이원화하고 중간 레이어는 학습 중에 전체 정밀도로 유지한다.
  • 가중치와 임계값에 대해 적응형 학습률 스케줄링 및 SGD/Adam 옵timizer를 사용하며, 임계값은 각 레이어의 최대 절대 가중치의 10%로 초기화한다.

실험 결과

연구 질문

  • RQ1학습 중에 양자화기 임계값과 네트워크 가중치를 함께 최적화하는 것이 이원화 신경망의 정확도 향상에 기여하는가?
  • RQ2이원화 함수의 닫힌 형태의 미분 가능 근사가 양자화기 내에서 효과적인 백프로파게이션을 가능하게 하는가?
  • RQ3직선통 추정기에서 기울기 정확도 최적화가 수렴 속도와 최종 정확도에 어떤 영향을 미치는가?
  • RQ4제안된 방법에서 임계값 초기화가 학습 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 전체 이원화를 적용한 ResNet-18을 사용하여 ImageNet에서 상위 1위 정확도 66.01%를 달성하였으며, 전체 정밀도 기준 대비 3.9%의 정확도 저하를 보였다.
  • ResNet-34의 경우, 상위 1위 정확도 70.79%를 달성하였으며, 전체 정밀도 모델 대비 2.52%의 정확도 저하를 보였다.
  • ResNet-50의 경우, 상위 1위 정확도 73.97%를 달성하였으며, 전체 정밀도 기준 대비 2.16%의 정확도 저하를 보였다.
  • 특히 전체 이원화 설정에서 기존 최고 성능 기술인 APPRENTICE와 TTN을 뛰어넘는 성능을 달성하였다.
  • 직선통 추정기에서 기울기 정확도 최적화를 적용할 경우, 학습 수렴이 훨씬 더 빠르고 안정적이게 되었다.
  • 임계값 초기화가 성능에 미치는 영향은 미미하였으며, 완전히 학습 가능한 임계값이 빠르게 학습 과정에서 적응하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.