Skip to main content
QUICK REVIEW

[논문 리뷰] LSTM-Sharp: An Adaptable, Energy-Efficient Hardware Accelerator for Long Short-Term Memory.

Reza Yazdani, Olatunji Ruwase|arXiv (Cornell University)|2019. 11. 04.
Topic Modeling참고 문헌 38인용 수 12
한 줄 요약

LSTM-Sharp는 재구성 가능하고 타일 기반인 하드웨어 가속기로, 지능적인 디스패칭과 피이핑된 스케줄링을 통해 LSTM 추론에서 발생하는 데이터 종속성과 낮은 자원 활용도 문제를 해결한다. 다양한 모델과 자원 예산에서 1.5x–82x의 성능 향상과 383 GFLOPs/W의 에너지 효율성을 달성한다.

ABSTRACT

The effectiveness of LSTM neural networks for popular tasks such as Automatic Speech Recognition has fostered an increasing interest in LSTM inference acceleration. Due to the recurrent nature and data dependencies of LSTM computations, designing a customized architecture specifically tailored to its computation pattern is crucial for efficiency. Since LSTMs are used for a variety of tasks, generalizing this efficiency to diverse configurations, i.e., adaptiveness, is another key feature of these accelerators. In this work, we first show the problem of low resource-utilization and adaptiveness for the state-of-the-art LSTM implementations on GPU, FPGA and ASIC architectures. To solve these issues, we propose an intelligent tiled-based dispatching mechanism that efficiently handles the data dependencies and increases the adaptiveness of LSTM computation. To do so, we propose LSTM-Sharp as a hardware accelerator, which pipelines LSTM computation using an effective scheduling scheme to hide most of the dependent serialization. Furthermore, LSTM-Sharp employs dynamic reconfigurable architecture to adapt to the model's characteristics. LSTM-Sharp achieves 1.5x, 2.86x, and 82x speedups on average over the state-of-the-art ASIC, FPGA, and GPU implementations respectively, for different LSTM models and resource budgets. Furthermore, we provide significant energy-reduction with respect to the previous solutions, due to the low power dissipation of LSTM-Sharp (383 GFLOPs/Watt).

연구 동기 및 목표

  • 기존 GPU, FPGA, ASIC 기반 LSTM 가속기에서의 낮은 자원 활용도와 적응성 부족 문제를 해결하기 위해.
  • LSTM 계산에 내재된 반복적 데이터 종속성을 효율적으로 관리할 수 있는 하드웨어 가속기 설계를 위해.
  • 다양한 LSTM 모델 특성과 자원 예산에 맞게 동적으로 재구성 가능하도록 하기 위해.
  • 다양한 LSTM 워크로드에서 높은 성능과 에너지 효율성을 달성하기 위해.

제안 방법

  • 데이터 종속성을 효과적으로 관리하고 자원 활용도를 향상시키기 위해 타일 기반 디스패칭 메커니즘을 제안한다.
  • 반복 계산에서 발생하는 직렬화 지연을 숨기기 위해 피이핑된 스케줄링 기법을 적용한다.
  • 다양한 LSTM 모델 구성에 맞게 가속기 아키텍처를 동적으로 재구성함으로써 유연성을 확보한다.
  • 저전력 소모를 최적화하여 383 GFLOPs/W의 에너지 효율성을 달성한다.
  • 재구성 가능성을 통해 다양한 LSTM 모델 크기와 레이어 구성 지원을 아키텍처 수준에서 설계한다.
  • 통합된 효율적인 메모리 액세스 패턴과 계산 스케줄링을 통해 최대 처리량을 극대화한다.

실험 결과

연구 질문

  • RQ1LSTM 계산에서 발생하는 데이터 종속성을 효과적으로 관리하여 자원 활용도를 향상시킬 수 있는 방법은 무엇인가?
  • RQ2다양한 LSTM 모델 구성에 걸쳐 높은 적응성을 확보할 수 있는 아키텍처 설계는 무엇인가?
  • RQ3피이핑과 스케줄링은 어떻게 LSTM 추론에서 반복적 직렬화의 영향을 줄일 수 있는가?
  • RQ4재구성 가능한 하드웨어 가속기를 통해 얻을 수 있는 성능 및 에너지 효율 수준은 어느 정도인가?
  • RQ5제안된 가속기는 최신 기술의 GPU, FPGA, ASIC 구현과 비교해 성능 및 에너지 효율에서 어떤가?

주요 결과

  • LSTM-Sharp는 다양한 LSTM 모델에서 최신 ASIC 구현 대비 평균 1.5배의 성능 향상을 달성한다.
  • 동일한 자원 제약 조건 하에서 FPGA 기반 가속기 대비 평균 2.86배의 성능 향상을 제공한다.
  • GPU 구현 대비 최대 82배의 성능 향상을 기록하여 LSTM 추론 분야에서 뛰어난 성능을 입증한다.
  • LSTM-Sharp는 383 GFLOPs/W의 에너지 효율성을 달성하여 이전 솔루션 대비 전력 소모를 크게 줄였다.
  • 동적 재구성 아키텍처는 다양한 모델 크기와 레이어 구성에 효과적으로 대응할 수 있도록 한다.
  • 지능적인 타일 기반 디스패칭 메커니즘이 직렬화 지연을 효과적으로 숨기고 하드웨어 활용도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.