Skip to main content
QUICK REVIEW

[논문 리뷰] Accumulation Bit-Width Scaling For Ultra-Low Precision Training Of Deep Networks

Charbel Sakr, Naigang Wang|arXiv (Cornell University)|2019. 01. 19.
Advanced Neural Network Applications인용 수 13
한 줄 요약

이 논문은 부분합 분포에서 유도된 분산 기반 경계를 사용하여 초저밀도 훈련을 위한 최소 누적 비트 폭을 분석적으로 결정하는 통계적 방법을 제안한다. 이 방법은 정밀도 저하 없이 누적기의 정밀도를 정밀하게 조정함으로써 FPU 하드웨어에서 최대 2.2배의 면적 및 전력 절감을 가능하게 하여 전체 정밀도 기준선에 수렴한다.

ABSTRACT

Efforts to reduce the numerical precision of computations in deep learning training have yielded systems that aggressively quantize weights and activations, yet employ wide high-precision accumulators for partial sums in inner-product operations to preserve the quality of convergence. The absence of any framework to analyze the precision requirements of partial sum accumulations results in conservative design choices. This imposes an upper-bound on the reduction of complexity of multiply-accumulate units. We present a statistical approach to analyze the impact of reduced accumulation precision on deep learning training. Observing that a bad choice for accumulation precision results in loss of information that manifests itself as a reduction in variance in an ensemble of partial sums, we derive a set of equations that relate this variance to the length of accumulation and the minimum number of bits needed for accumulation. We apply our analysis to three benchmark networks: CIFAR-10 ResNet 32, ImageNet ResNet 18 and ImageNet AlexNet. In each case, with accumulation precision set in accordance with our proposed equations, the networks successfully converge to the single precision floating-point baseline. We also show that reducing accumulation precision further degrades the quality of the trained network, proving that our equations produce tight bounds. Overall this analysis enables precise tailoring of computation hardware to the application, yielding area- and power-optimal systems.

연구 동기 및 목표

  • 저밀도 딥 뉴럴 네트워크 훈련에서 최적의 누적 정밀도를 결정하는 이론적 프레임워크 부족 문제를 해결하기 위해.
  • 실제로는 32비트 누적기의 보수적인 사용이 존재함에도 불구하고, 가중치 및 활성화의 정밀도가 감소함에도 불구하고 하드웨어 효율성을 제한한다는 점을 해결하기 위해.
  • 브루트포스 시뮬레이션 또는 히우리스틱 설계 없이도 정밀도를 정확히 설정할 수 있는 분석적으로 유도된 방법을 제공하기 위해.
  • 제안된 정밀도 경계가 타이트하고 과도하게 보수적이지 않음을 검증하여 전체 정밀도 기준선에 수렴함을 보장하기 위해.
  • 정밀도 예측을 정확히 수행함으로써 저밀도 DNN 훈련을 위한 하드웨어 최적화된 면적 및 전력 효율적인 FPU 설계를 가능하게 하기 위해.

제안 방법

  • GEMM 연산에서 부분합의 분산과 누적 비트 폭, 시퀀스 길이 사이의 관계를 설명하는 통계 모델을 유도한다.
  • 감소된 누적 정밀도로 인한 정보 손실을 정량화하기 위해 분산 감소 비율(VRR) 지표를 도입한다.
  • VRR을 사용하여 분산 손실이 허용 가능한 범위 내에 유지될 수 있도록 최소 비트 수를 계산한다.
  • 세 가지 벤치마크 네트워크(CIFAR-10 ResNet-32, ImageNet ResNet-18, ImageNet AlexNet)에 유도된 방정식를 적용한다.
  • 정밀도 펌터베이션(PP)을 통한 훈련 실험을 수행하여 전체 정밀도 기준선과의 수렴성을 비교함으로써 예측을 검증한다.
  • 정상 및 청크 기반 누적 방식을 모두 고려하여 정밀도 예측의 민감도 및 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1초저밀도 DNN 훈련에서 수렴 정밀도를 유지하기 위해 필요한 최소 누적 비트 폭은 무엇인가?
  • RQ2감소된 누적 정밀도는 부분합의 분산에 어떤 영향을 미치며, 이는 모델 수렴에 어떻게 영향을 주는가?
  • RQ3분산 동역학을 기반으로 한 통계 모델은 경험적 시행착오 없이 안정적인 훈련을 위한 최소 정밀도를 예측할 수 있는가?
  • RQ4유도된 정밀도 경계는 얼마나 타이트한가? 더 이상의 정밀도 감소는 예측된 임계값을 초과해 성능 저하를 초래하는가?
  • RQ5히우리스틱 또는 브루트포스 설계 접근 방식에 비해 이 방법은 하드웨어 최적화된 DNN 훈련에서 강건성과 정확도 면에서 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 세 벤치마크 네트워크 전반에서 전체 정밀도 기준선과 0.5% 이내로 수렴할 수 있는 누적 비트 폭을 성공적으로 예측하였다.
  • 정밀도가 예측된 최소값 이하로 감소할 경우(PP < 0), 정확도가 크게 저하됨을 확인하여 유도된 경계가 타이트함을 입증하였다.
  • ImageNet ResNet-18는 정밀도 감소에 가장 민감하며, 한 비트 감소로도 정확도 저하가 0.5%를 초과한다.
  • ImageNet AlexNet는 과다 매개변수화된 아키텍처로 인해 정밀도 펌터베이션에 더 강건한 편이지만, 여전히 정밀도가 낮아질수록 저하가 증가하는 경향을 따른다.
  • 청크 기반 누적은 정상 누적보다 정밀도 감소에 더 민감한 편이며, 동일한 비트 감소가 더 낮은 정밀도 할당에 대해 더 큰 상대적 변화를 의미하기 때문이다.
  • 이 방법은 과잉 확보된 누적 정밀도를 제거함으로써 FPU 하드웨어에서 최대 2.2배의 면적 절감을 가능하게 하여 뚜렷한 하드웨어 효율성 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.