Skip to main content
QUICK REVIEW

[논문 리뷰] RNNAccel: A Fusion Recurrent Neural Network Accelerator for Edge Intelligence

Chao-Yang Kao, Huang-Chih Kuo|arXiv (Cornell University)|2020. 10. 26.
Ferroelectric and Negative Capacitance Devices참고 문헌 5인용 수 7
한 줄 요약

RNNAccel은 엣지 AI에서 메모리 대역폭, 에너지 효율성, 정확도 손실 문제를 해결하기 위해 32-MAC 어레이와 NeuCompression 엔진을 통합한 구성 가능한 RNN 가속기입니다. 40nm 공정에서 90%의 MAC 활용도, 1.27 TOPs/W의 에너지 효율성, 8배의 모델 압축, 키워드 스폴팅 작업에서 90%의 추론 정확도를 달성하였으며, SoC 통합을 위한 비트 정확한 시뮬레이션을 지원합니다.

ABSTRACT

Many edge devices employ Recurrent Neural Networks (RNN) to enhance their product intelligence. However, the increasing computation complexity poses challenges for performance, energy efficiency and product development time. In this paper, we present an RNN deep learning accelerator, called RNNAccel, which supports Long Short-Term Memory (LSTM) network, Gated Recurrent Unit (GRU) network, and Fully Connected Layer (FC)/ Multiple-Perceptron Layer (MLP) networks. This RNN accelerator addresses (1) computing unit utilization bottleneck caused by RNN data dependency, (2) inflexible design for specific applications, (3) energy consumption dominated by memory access, (4) accuracy loss due to coefficient compression, and (5) unpredictable performance resulting from processor-accelerator integration. Our proposed RNN accelerator consists of a configurable 32-MAC array and a coefficient decompression engine. The MAC array can be scaled-up to meet throughput requirement and power budget. Its sophisticated off-line compression and simple hardware-friendly on-line decompression, called NeuCompression, reduces memory footprint up to 16x and decreases memory access power. Furthermore, for easy SOC integration, we developed a tool set for bit-accurate simulation and integration result validation. Evaluated using a keyword spotting application, the 32-MAC RNN accelerator achieves 90% MAC utilization, 1.27 TOPs/W at 40nm process, 8x compression ratio, and 90% inference accuracy.

연구 동기 및 목표

  • 엔드 디바이스에서 RNN 데이터 의존성으로 인한 계산 단위 활용도 저하 문제 해결.
  • RNN 추론 워크로드에서 메모리 액세스에 의해 지배되는 에너지 소비 감소.
  • 모델 계수의 정밀도 낮추기 및 압축으로 인한 정확도 손실 최소화.
  • 다양한 엣지 AI 워크로드에 대응하는 유연하고 응용 분야에 구애받지 않는 RNN 가속화 지원.
  • 비트 정확한 시뮬레이션 도구를 통한 예측 가능한 성능 확보 및 SoC 통합의 원활함 확보.

제안 방법

  • 스루풋 및 전력 제약에 대응하기 위해 확장 가능한 구성 가능한 32-MAC 어레이 설계.
  • NeuCompression—하드웨어 우수한 온라인 복원 기법—구현을 통해 최대 16배의 모델 압축을 실현하고 면적 오버헤드를 최소화.
  • 계수 복원 엔진 통합으로 메모리 프로파일 감소 및 외부 메모리 액세스 에너지 절감.
  • 오프라인 모델 압축과 온라인 복원을 조합하여 저장소 및 대역폭을 최소화하면서도 모델 정확도 유지.
  • 시스템온칩(SoC) 플랫폼과의 통합 결과를 검증하기 위한 비트 정확한 시뮬레이션 및 검증 도구 세트 개발.
  • LSTM, GRU, FC 및 MLP 레이어 등 다양한 RNN 유형 지원으로 엣지 AI 응용 분야에 광범위하게 적용 가능.

실험 결과

연구 질문

  • RQ1RNN 가속기의 본질적 데이터 의존성에도 불구하고 어떻게 높은 MAC 활용도를 달성할 수 있는가?
  • RQ2모델 압축이 정확도 손실 없이 얼마나 메모리 프로파일과 액세스 에너지를 줄일 수 있는가?
  • RQ3통합된 가속기 아키텍처는 어떻게 다양한 RNN 아키텍처(LSTM, GRU, FC/MLP)를 효율적으로 지원할 수 있는가?
  • RQ4하드웨어 우수한 압축 및 복원 기법이 에너지 효율성과 면적 오버헤드에 어떤 영향을 미치는가?
  • RQ5프로세서와의 가속기 통합을 어떻게 예측 가능하고 원활하게 SoC 배포에 대비할 수 있는가?

주요 결과

  • 32-MAC RNNAccel은 90%의 MAC 활용도를 달성하여 기존 설계 대비 계산 효율성 크게 향상.
  • 40nm 공정 기반으로 1.27 TOPs/W의 에너지 효율성 확보하여 높은 성능-와트 비율 입증.
  • NeuCompression을 통해 최대 16배의 모델 압축 구현, 실질적으로 메모리 프로파일과 액세스 에너지를 8배 감소.
  • 키워드 스폴팅 작업에서 90%의 추론 정확도 유지하여 압축으로 인한 정확도 손실 최소화 검증.
  • 비트 정확한 시뮬레이션 및 통합 도구 세트를 통해 예측 가능하고 신뢰할 수 있는 SoC 배포 보장.
  • LSTM, GRU, FC, MLP 등 다양한 RNN 유형 지원으로 엣지 지능형 워크로드에 광범위하게 적용 가능.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.