Skip to main content
QUICK REVIEW

[논문 리뷰] DPRed: Making Typical Activation Values Matter In Deep Learning Computing.

Alberto Delmás, Sayeh Sharify|arXiv (Cornell University)|2018. 04. 17.
Advanced Neural Network Applications참고 문헌 55인용 수 14
한 줄 요약

DPRed는 활성화 값의 정밀도를 층 단위보다 더 세밀한 분해능으로 실시간으로 동적으로 조정할 수 있는 기법을 제안한다. 이는 DPRed 스트립스(DPRS)라는 하드웨어 가속기 기반으로 이루어지며, 합성곱 신경망에서 고정 정밀도 가속기 대비 2.61배 빠른 성능 향상과 1.84배 높은 에너지 효율성을 달성한다. 특히 완전 연결 계층에서는 더 큰 성능 향상이 이루어진다.

ABSTRACT

We show that selecting a fixed precision for all activations in Convolutional Neural Networks, even if that precision is different per layer, amounts to worst case design. We show that much lower precisions can be used, if we could target the common case instead by tailoring the precision at a much finer granularity than that of a layer. We propose Dynamic Prediction Reduction (DPRed) where hardware on-the-fly detects the precision activations need and at a much finer granularity than a whole layer. We demonstrate a practical implementation of DPRed with DPRed Stripes (DPRS), a data-parallel hardware accelerator that adjusts precision on-the-fly to accommodate the values of the activations it processes concurrently. DPRS accelerates convolutional layers and executes unmodified convolutional neural networks. DPRS is 2.61x faster and 1.84x more energy efficient than a fixed-precision accelerator for a set of convolutional neural networks. We further extend DPRS to exploit activation and weight precisions for fully-connected layers. The enhanced design improves average performance and energy efficiency respectively by 2.59x and 1.19x over the fixed-precision accelerator for a broader set of neural networks. We also consider a lower cost variant that supports only even precision widths which offers better energy efficiency.

연구 동기 및 목표

  • 모든 활성화 값에 대해 고정 정밀도 계산을 적용할 경우, 수치 범위가 상이한 값들조차 동일하게 취급되는 비효율성을 해결한다.
  • 모든 층 내에서 활성화 분포의 미세한 변동성을 반영하지 못하는 층 수준의 정밀도 선택 기법의 한계를 극복한다.
  • 실시간으로 각 활성화 값에 맞게 정밀도를 조정할 수 있는 하드웨어 가속기를 설계하여 성능과 에너지 효율을 향상시킨다.
  • 기존 모델에 대한 재학습이나 네트워크 수정 없이도 최소한의 아키텍처 변경으로도 동적 정밀도 제어를 하드웨어 수준에서 통합하여 효율적인 실행을 가능하게 한다.
  • 완전 연결 계층으로 이 기법을 확장하고, 더 넓은 범위의 신경망 아키텍처에서 성능을 평가한다.

제안 방법

  • 각 활성화 값의 크기와 분포에 기반해 필요한 최소 정밀도를 식별하는 동적 예측 감소(DPRed) 기법을 도입한다.
  • 실시간으로 활성화 값의 정밀도를 동적으로 조정할 수 있는 데이터 병렬 하드웨어 가속기인 DPRed 스트립스(DPRS)를 구현한다.
  • 실행 시점 메커니즘을 통해 활성화 값의 범위를 탐지하고, 개별 값 또는 소규모 그룹 단위로 최적의 정밀도 폭을 선택한다.
  • 전체 설계에서 홀수 및 짝수 정밀도 폭을 모두 지원하며, 에너지 효율 향상을 위해 짝수 정밀도 폭 전용 저비용 버전도 제공한다.
  • 모델 재학습이나 네트워크 수정 없이도 인퍼런스 파이프라인에 DPRS를 통합하여 기존 모델과의 호환성을 확보한다.
  • 가중치와 활성화 값 양쪽에 대해 정밀도 선택을 적응시켜 완전 연결 계층으로의 확장을 도모하며, 고밀도 계층의 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1합성곱 신경망 인퍼런스에서 고정 정밀도 계산 대비 활성화 값 별 동적 정밀도 선택이 성능과 에너지 효율성 측면에서 뛰어난가?
  • RQ2층 수준보다 더 세밀한 분해능에서 실시간 정밀도 조정이 가속기 성능 향상에 측정 가능한 기여를 하는가?
  • RQ3다양한 합성곱 신경망 아키텍처에서 DPRS는 고정 정밀도 기준 대비 어떻게 성능을 발휘하는가?
  • RQ4정밀도 적응을 완전 연결 계층으로 확장할 경우, 높은 성능과 효율성을 유지할 수 있는가?
  • RQ5가속기 설계에서 짝수 정밀도 폭만 지원할 경우, 하드웨어 복잡성과 에너지 효율성 간의 상호 상충 관계는 어떠한가?

주요 결과

  • DPRed 스트립스(DPRS)는 일련의 합성곱 신경망에서 고정 정밀도 가속기 대비 2.61배 빠른 성능 향상과 1.84배 높은 에너지 효율성을 달성한다.
  • 완전 연결 계층으로 확장한 경우, 개선된 DPRS 설계는 고정 정밀도 기준 대비 평균 성능을 2.59배 향상시키고 에너지 효율을 1.19배 향상시킨다.
  • 짝수 정밀도 폭만 지원하는 저비용 버전의 DPRS는 전체 정밀도 버전보다 더 높은 에너지 효율성을 제공하면서도 하드웨어 복잡성을 감소시킨다.
  • DPRS의 동적 정밀도 선택 메커니즘은 모델 재학습 없이도 뚜렷한 성능 향상을 이끌어내며, 아키텍처 변경 없이도 기능한다.
  • 이 기법은 고정 정밀도 층 단위 설계의 최악의 경우를 피하기 위해 세밀한 분해능에서 활성화 값의 특성에 맞게 정밀도를 조정함으로써 일반적인 케이스의 활성화 값을 효과적으로 대상으로 삼는다.
  • 결과적으로, 정확도를 훼손하지 않으면서도 활성화 값 별로 정밀도를 크게 감소시킬 수 있음을 입증하여, 상당한 효율성 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.