Skip to main content
QUICK REVIEW

[論文レビュー] LSTM-Sharp: An Adaptable, Energy-Efficient Hardware Accelerator for Long Short-Term Memory.

Reza Yazdani, Olatunji Ruwase|arXiv (Cornell University)|Nov 4, 2019
Topic Modeling参考文献 38被引用数 12
ひとこと要約

LSTM-Sharp は、知的なディスpatchおよびパイプラインスケジューリングを用いて、LSTM推論におけるデータ依存性とリソース利用効率の低さを克服する再構成可能でタイル型のハードウェアアクセラレータである。多様なモデルとリソース予算において、1.5x~82xのスピードアップと383 GFLOPs/Wのエネルギー効率を達成している。

ABSTRACT

The effectiveness of LSTM neural networks for popular tasks such as Automatic Speech Recognition has fostered an increasing interest in LSTM inference acceleration. Due to the recurrent nature and data dependencies of LSTM computations, designing a customized architecture specifically tailored to its computation pattern is crucial for efficiency. Since LSTMs are used for a variety of tasks, generalizing this efficiency to diverse configurations, i.e., adaptiveness, is another key feature of these accelerators. In this work, we first show the problem of low resource-utilization and adaptiveness for the state-of-the-art LSTM implementations on GPU, FPGA and ASIC architectures. To solve these issues, we propose an intelligent tiled-based dispatching mechanism that efficiently handles the data dependencies and increases the adaptiveness of LSTM computation. To do so, we propose LSTM-Sharp as a hardware accelerator, which pipelines LSTM computation using an effective scheduling scheme to hide most of the dependent serialization. Furthermore, LSTM-Sharp employs dynamic reconfigurable architecture to adapt to the model's characteristics. LSTM-Sharp achieves 1.5x, 2.86x, and 82x speedups on average over the state-of-the-art ASIC, FPGA, and GPU implementations respectively, for different LSTM models and resource budgets. Furthermore, we provide significant energy-reduction with respect to the previous solutions, due to the low power dissipation of LSTM-Sharp (383 GFLOPs/Watt).

研究の動機と目的

  • 既存のGPU、FPGA、ASICベースのLSTMアクセラレータにおけるリソース利用効率の低さと柔軟性の欠如を解決すること。
  • LSTM計算に内在する再帰的データ依存性を効率的に管理できるハードウェアアクセラレータの設計。
  • 異なるLSTMモデルの特性とリソース予算に応じて動的に再構成可能であることを実現すること。
  • 多様なLSTMワークロードにおいて高いパフォーマンスとエネルギー効率を達成すること。

提案手法

  • データ依存性を管理し、リソース利用効率を向上させるタイル型ディスpatchメカニズムを提案する。
  • 再帰的計算に起因するシリアル化遅延を隠ぺいするためのパイプラインスケジューリング方式を採用する。
  • 異なるLSTMモデル構成に適応できるように、動的再構成を用いる。
  • 低消費電力設計を最適化し、383 GFLOPs/Wのエネルギー効率を達成する。
  • 再構成性を活かして、複数のLSTMモデルサイズとレイヤー構成をサポートするアクセラレータアーキテクチャを設計する。
  • スループットを最大化するために、効率的なメモリアクセスパターンと計算スケジューリングを統合する。

実験結果

リサーチクエスチョン

  • RQ1LSTM計算におけるデータ依存性を効果的に管理することで、リソース利用効率を向上させることは可能か?
  • RQ2どのようなアーキテクチャ設計が、多様なLSTMモデル構成にわたる高い適応性を実現できるか?
  • RQ3パイプライン処理とスケジューリングにより、LSTM推論における再帰的シリアル化の影響をどのように軽減できるか?
  • RQ4再構成可能なハードウェアアクセラレータを用いることで、どの程度のパフォーマンスとエネルギー効率が達成できるか?
  • RQ5最先端のGPU、FPGA、ASIC実装と比較して、提案されたアクセラレータはパフォーマンスおよびエネルギー効率でどのように差をつけるか?

主な発見

  • LSTM-Sharp は、多様なLSTMモデルにおいて、最先端のASIC実装と比較して平均1.5倍のスピードアップを達成した。
  • 同じリソース制約下で、FPGAベースのアクセラレータと比較して平均2.86倍のスピードアップを実現した。
  • GPU実装と比較して最大82倍のスピードアップを達成し、LSTM推論において優れたパフォーマンスを示した。
  • LSTM-Sharp は383 GFLOPs/Wのエネルギー効率を達成し、先行ソリューションと比較して顕著な消費電力低減を実現した。
  • 動的再構成アーキテクチャにより、異なるモデルサイズやレイヤー構成への効果的な適応が可能となった。
  • 知的なタイルディスpatchメカニズムにより、シリアル化遅延が効果的に隠され、ハードウェア利用効率が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。