Skip to main content
QUICK REVIEW

[논문 리뷰] Training and Inference with Integers in Deep Neural Networks

Shuang Wu, Guoqi Li|arXiv (Cornell University)|2018. 02. 13.
Advanced Neural Network Applications참고 문헌 24인용 수 200
한 줄 요약

WAGE는 학습과 추론을 모두 저비트폭 정수로 양자화하여 DNN에 대한 순수한 정수 데이터 흐름을 가능하게 하고, 여러 데이터셋에서 경쟁력 있는 정확도를 달성한다.

ABSTRACT

Researches on deep neural networks with discrete parameters and their deployment in embedded systems have been active and promising topics. Although previous works have successfully reduced precision in inference, transferring both training and inference processes to low-bitwidth integers has not been demonstrated simultaneously. In this work, we develop a new method termed as "WAGE" to discretize both training and inference, where weights (W), activations (A), gradients (G) and errors (E) among layers are shifted and linearly constrained to low-bitwidth integers. To perform pure discrete dataflow for fixed-point devices, we further replace batch normalization by a constant scaling layer and simplify other components that are arduous for integer implementation. Improved accuracies can be obtained on multiple datasets, which indicates that WAGE somehow acts as a type of regularization. Empirically, we demonstrate the potential to deploy training in hardware systems such as integer-based deep learning accelerators and neuromorphic chips with comparable accuracy and higher energy efficiency, which is crucial to future AI applications in variable scenarios with transfer and continual learning demands.

연구 동기 및 목표

  • 임베디드 AI 시스템을 위한 저비트폭 정수 하드웨어에서의 학습을 동기 부여하고 가능하게 한다.
  • 전방향 및 역전파를 모두 지원하는 전체 정수 데이터 흐름(W,A,G,E)을 개발한다.
  • 방향 정보를 보존하면서 비트폭을 제어하기 위해 shift 기반 양자화와 확률적 반올림을 제안한다.
  • 레이어별 상수 스케일링 계수를 도입하여 부동 소수점 배치 정규화에 대한 의존성을 제거한다.

제안 방법

  • 네 가지 양자화 연산자 Q_W, Q_A, Q_G, Q_E가 가중치, 활성화, 기울기, 오차를 저비트폭 정수로 제약한다.
  • 포화를 동반한 Shift 기반 선형 매핑 Q(x,k)으로 균일 양자화를 구현한다.
  • 가중치 증폭을 약화시키고 배치 정규화를 대체하기 위한 레이어별 shift 기반 스케일링 인자 alpha를 사용한다.
  • 방향 정보를 보존하는 동시에 기울기 업데이트의 비트폭을 제한하기 위해 확률적 반올림을 적용한다.
  • 학습은 정수 데이터 흐름 제약에 맞추기 위해 모멘텀이나 적응 학습률 없이 미니배치 SGD를 사용한다.
  • 기본 2-8-8-8 비트 구성으로 MNIST, SVHN, CIFAR-10, ImageNet에 대한 평가.

실험 결과

연구 질문

  • RQ1순수 저비트폭 정수 데이터 흐름으로 엔드-투-엔드 학습과 추론을 수행할 수 있는가?
  • RQ2표준 데이터셋 전반에서 정확도를 유지하기 위해 W, A, G, E의 필요한 비트폭은 얼마인가?
  • RQ3배치 정규화를 상수 스케일링 계층으로 대체하는 것이 학습과 정확도에 어떤 영향을 미치는가?
  • RQ4정수 기반 학습과 역전파의 양자화에서 어떤 규제 효과가 발생하는가?

주요 결과

  • WAGE는 추론 시의 이산화 기반 기준선과 비슷한 정확도를 달성하고 정규화 효과를 제공한다.
  • 2-8-8-8 비트 구성은 추론 시 3진 가중치를 가능하게 하면서도 학습 중 활성화, 오차, 기울기에 대해 8비트 표현을 유지한다.
  • MNIST, SVHN, CIFAR-10에서 WAGE는 경쟁력 있는 오차율을 보이며(예: MNIST 0.40%, SVHN 1.92%, CIFAR-10 6.78%).
  • ImageNet의 AlexNet에서 WAGE 패턴은 2888 패턴의 경우 상위 1위/상위 5위 오차가 약 51.6/27.8로 나타나 대형 데이터세트에 대한 확장성을 시사한다.
  • 비트폭 분석에 따르면 CIFAR-10에 대해 오차 비트폭 k_E가 대략 4–8비트로 충분하고 기울기 비트폭 k_G가 대략 6–8비트로 수렴성과 정확도의 균형을 이룬다.
  • 기울기의 양자화는 통신 효율적인 학습을 가능하게 하고 적절한 하이퍼파라미터 하에서 최종 성능 저하 없이 메모리 사용량을 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.