[논문 리뷰] SparseNN: An Energy-Efficient Neural Network Accelerator Exploiting Input and Output Sparsity
SparseNN는 입력 및 출력 활성화의 흐าก임을 종합적으로 활용하는 에너지 효율적인 DNN 가속기로, 종단 간 흐림 예측기를 통해 구현된다. 출력 흐림 예측에 5% 미만의 계산 오버헤드를 유발함으로써, 입력 흐림만을 활용하는 최신 가속기 대비 10–70% 높은 처리량과 50% 낮은 전력 소비를 달성한다.
Contemporary Deep Neural Network (DNN) contains millions of synaptic connections with tens to hundreds of layers. The large computation and memory requirements pose a challenge to the hardware design. In this work, we leverage the intrinsic activation sparsity of DNN to substantially reduce the execution cycles and the energy consumption. An end-to-end training algorithm is proposed to develop a lightweight run-time predictor for the output activation sparsity on the fly. From our experimental results, the computation overhead of the prediction phase can be reduced to less than 5% of the original feedforward phase with negligible accuracy loss. Furthermore, an energy-efficient hardware architecture, SparseNN, is proposed to exploit both the input and output sparsity. SparseNN is a scalable architecture with distributed memories and processing elements connected through a dedicated on-chip network. Compared with the state-of-the-art accelerators which only exploit the input sparsity, SparseNN can achieve a 10%-70% improvement in throughput and a power reduction of around 50%.
연구 동기 및 목표
- 임베디드 시스템에서 깊이 있는 신경망(DNN)의 높은 에너지 및 메모리 요구량을 해결한다.
- 이전 가속기들이 입력 흐림만을 활용하는 데에 국한된 한계를 극복한다.
- 최소한의 계산 오버헤드를 유발하는 런타임 출력 활성화 흐림 예측기 개발.
- 입력 및 출력 흐림을 효율적으로 활용하기 위한 확장 가능한 NoC 기반 하드웨어 아키텍처(SparseNN) 설계.
- 기존 SIMD 및 EIE 스타일 가속기 대비 처리량 및 에너지 효율성 향상의 실증.
제안 방법
- 출력 흐림 예측을 위한 U 및 V 행렬을 백프로파게이션을 통해 학습하는 종단 간 학습 알고리즘 제안.
- 피드포워드 단계에서 5% 이내의 오버헤드로 실제 계산 이전에 출력 흐림을 예측하기 위해 잘린 SVD 유사 분해를 사용.
- 고병렬성을 위한 분산 처리 요소(PE)와 메모리가 탑재된 확장 가능한 네트워크 온 칩(NoC) 아키텍처 설계.
- 입력 및 출력 특징 맵의 영향을 받지 않는 0 활성화를 건너뛰기 위한 흐림 인식 메모리 액세스 및 계산 스케줄링 통합.
- 65nm 공정을 사용한 ASIC에서 SparseNN 구현, 가중치(W)를 위한 온칩 SRAM과 흐림 예측을 위한 보조 행렬(U, V) 탑재.
- PE와 메모리를 연결하기 위한 전용 온칩 네트워크를 구현하여 통신 병목 현상을 최소화하고 확장성 확보.
실험 결과
연구 질문
- RQ1최소한의 계산 오버헤드를 유발하는 종단 간 훈련된 출력 활성화 흐림 예측기를 설계할 수 있는가?
- RQ2입력 및 출력 흐림을 동시에 활용할 경우 DNN 추론의 처리량과 에너지 효율성에 어떤 영향을 미치는가?
- RQ3확장 가능한 NoC 기반 하드웨어 아키텍처는 입력 및 출력 흐림 활용을 효율적으로 지원할 수 있는가?
- RQ4EIE 및 LRADNN과 같은 최신 가속기 대비 SparseNN의 성능 및 에너지 효율성 향상은 어느 정도인가?
- RQ5다양한 네트워크 랭크와 DNN 모델에서 흐림 예측 정확도와 확장성은 어떻게 변하는가?
주요 결과
- 흐림 예측 단계는 원래 피드포워드 단계에 5% 미만의 계산 오버헤드를 추가하며, 정확도 손실은 무시할 만큼 낮다.
- 입력 흐림만을 활용하는 가속기 대비 SparseNN은 레이어 및 데이터셋에 따라 10–70% 높은 처리량을 달성한다.
- 입력 및 출력 흐림을 함께 활용함으로써 메모리 액세스 감소와 저에너지 흐림 예측 덕분에 전력 소비가 약 50% 감소한다.
- 면적 분석 결과 총 면적의 94.8%가 메모리(주로 W, U, V 행렬용 온칩 SRAM)에 소비되며, PEs는 메모리 면적의 99.2%를 차지한다.
- 28nm SIMD 아키텍처(DNN-Engine)를 65nm로 스케일업했을 때 SparseNN은 효과적인 흐림 활용 덕분에 에너지 효율성에서 4배 향상된다.
- 실행 사이클 수의 향상은 깊이 있는 레이어에서 가장 두드러지며(최대 70% 감소), 이는 이전 레이어의 예측 출력 흐림이 다음 레이어의 입력 흐림을 향상시킴으로써 발생한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.