Skip to main content
QUICK REVIEW

[논문 리뷰] A Low-Power Accelerator for Deep Neural Networks with Enlarged Near-Zero Sparsity

Yuxiang Huan, Yifan Qin|arXiv (Cornell University)|2017. 05. 22.
Radiation Detection and Scintillator Technologies참고 문헌 10인용 수 5
한 줄 요약

이 논문은 near-zero sparsity를 활용하여 기존의 0값 sparsity를 초월하는 저전력 DNN 가속기를 제안한다. Near-Zero Approximation Unit (NZAU)를 통해 작은 가중치를 가진 활성화값의 곱셈을 건너뛰며, 구성 가능한 임계값 이하의 근접된 0값을 동적으로 식별하고 근사화함으로써 LeNet-5에서 1.92배, AlexNet에서 1.51배의 곱셈을 감소시킨다. 정확도 손실은 극히 미미하며, UMC 65nm 공정에서 500MHz에서 동작할 때 이동형 GPU보다 에너지 소비가 717배 적고, 4배 빠르게 작동한다.

ABSTRACT

It remains a challenge to run Deep Learning in devices with stringent power budget in the Internet-of-Things. This paper presents a low-power accelerator for processing Deep Neural Networks in the embedded devices. The power reduction is realized by avoiding multiplications of near-zero valued data. The near-zero approximation and a dedicated Near-Zero Approximation Unit (NZAU) are proposed to predict and skip the near-zero multiplications under certain thresholds. Compared with skipping zero-valued computations, our design achieves 1.92X and 1.51X further reduction of the total multiplications in LeNet-5 and Alexnet respectively, with negligible lose of accuracy. In the proposed accelerator, 256 multipliers are grouped into 16 independent Processing Lanes (PL) to support up to 16 neuron activations simultaneously. With the help of data pre-processing and buffering in each PL, multipliers can be clock-gated in most of the time even the data is excessively streaming in. Designed and simulated in UMC 65 nm process, the accelerator operating at 500 MHz is $>$ 4X faster than the mobile GPU Tegra K1 in processing the fully-connected layer FC8 of Alexnet, while consuming 717X less energy.

연구 동기 및 목표

  • 전력 제약이 있는 IoT 기기에서 DNN 추론의 높은 에너지 소비 문제를 해결하기 위해.
  • 기존의 0값 건너뛰기 기법을 넘어, 계산적으로 낭비이지만 수치적으로 무시할 만한 근접 0값 곱셈까지 포함하여 확장하기 위해.
  • 전용 NZAU를 사용해 근접 0값 곱셈을 효율적으로 탐지하고 건너뛰는 하드웨어 가속기를 설계하여 정확도 손실 없이 에너지 효율성을 향상시키기 위해.
  • 256개의 다중기 아키텍처에서 데이터 버퍼링, 클럭 게이팅, 처리 랜드 병렬화를 조합하여 고처리량과 저전력 작동을 달성하기 위해.

제안 방법

  • Near-Zero Approximation Unit (NZAU)는 가중치와 활성화값의 곱이 구성 가능한 임계값 이하일 경우 이를 무시 가능하다고 간주하고 곱셈을 예측 및 건너뛰며, 이러한 값을 근사한다.
  • 근접 0값 sparsity는 가중치와 활성화값의 곱에 기반한 임계값 기반 근사화를 적용하여, 0값 요소를 초월한 sparsity를 달성한다.
  • 가속기는 16개의 독립적 처리 랜드(PLs)를 사용하며, 각 랜드는 16개의 다중기를 내장하여 동시에 16개의 뉴런 활성화값을 병렬 처리할 수 있다.
  • 각 PL 내에서의 데이터 사전 처리 및 버퍼링으로 다중기의 클럭 게이팅이 대부분의 사이클 동안 가능해져, 고속 데이터 스트림 상황에서도 동적 전력 소비를 줄인다.
  • 피연산자 버퍼링과 레지스터 격리 기법을 통합하여 데이터 저장과 계산을 분리함으로써, 유휴 전력 소비를 최소화한다.
  • 근접 0값 근사의 임계값은 조정 가능하여 정확도와 에너지 효율성 간의 트레이드오���을 가능하게 한다.

실험 결과

연구 질문

  • RQ1근접 0값 sparsity는 기존의 0값 sparsity를 초월하여 DNN 계산을 효과적으로 줄일 수 있는가?
  • RQ2오직 0값만 건너뛰는 것과 비교해 근접 0값을 근사화함으로써 추가로 곱셈과 에너지 소비를 얼마나 줄일 수 있는가?
  • RQ3정확도 손실이 크게 발생하지 않도록 하드웨어 가속기가 근접 0값 곱셈을 효율적으로 탐지하고 건너뛸 수 있는가?
  • RQ4일반 목적의 이동형 GPU 대비 전용 NZAU 기반 가속기가 DNN 추론에서 성능과 에너지 효율성에서 얼마나 향상되는가?

주요 결과

  • 제안된 근접 0값 근사로 LeNet-5의 sparsity는 29.4%에서 63.35%로 증가하였고, 오차율 증가가 0.58%에 불과하여 총 곱셈 수가 1.92배 감소하였다.
  • AlexNet에서는 근접 0값 근사 적용으로 sparsity가 45.9%에서 64.1%로 증가하였고, 정확도 손실은 극히 미미하며 곱셈 수가 1.51배 감소하였다.
  • AlexNet의 FC8 레이어 처리 시, 이동형 GPU인 Tegra K1 대비 4배 높은 처리량을 달성하였으며, UMC 65nm 공정에서 500MHz에서 동작하였다.
  • Tegra K1 GPU 대비 에너지 소비가 717배 감소하였고, 근접 0값 근사 적용 시 최종 전력 소모는 31mW였다.
  • 데이터 버퍼링과 NZAU로 인한 클럭 게이팅 덕분에, 0값 건너뛰기만으로는 달성할 수 없는 18.4%의 추가 전력 절감이 이루어졌다.
  • 효율적인 데이터 버퍼링과 16개의 독립적 처리 랜드에서의 파ipelined 처리 덕분에 고도로 활용되고 스탠드바이 상태가 발생하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.