Skip to main content
QUICK REVIEW

[論文レビュー] BRDS: An FPGA-based LSTM Accelerator with Row-Balanced Dual-Ratio Sparsification

Seyed Abolfazl Ghasemzadeh, Erfan Bank-Tavakoli|arXiv (Cornell University)|Jan 7, 2021
Neural Networks and Applications参考文献 16被引用数 8
ひとこと要約

本稿では、LSTMネットワークの2つの感受性の高い重み行列に異なるスパarsity比を適用し、行単位でスパarsityを整理することで、エネルギー消費を低減するとともに高速化を実現する、FPGAベースのLSTMアクセラレータ「BRDS」を提案する。このアーキテクチャにより、効率的な計算オーバーラップとパイプライン処理が可能となり、PTBデータセットにおけるパープレキシティを低減しつつ、先行研究と比較して最大272%高い有効なGOPSWを達成した。

ABSTRACT

In this paper, first, a hardware-friendly pruning algorithm for reducing energy consumption and improving the speed of Long Short-Term Memory (LSTM) neural network accelerators is presented. Next, an FPGA-based platform for efficient execution of the pruned networks based on the proposed algorithm is introduced. By considering the sensitivity of two weight matrices of the LSTM models in pruning, different sparsity ratios (i.e., dual-ratio sparsity) are applied to these weight matrices. To reduce memory accesses, a row-wise sparsity pattern is adopted. The proposed hardware architecture makes use of computation overlapping and pipelining to achieve low-power and high-speed. The effectiveness of the proposed pruning algorithm and accelerator is assessed under some benchmarks for natural language processing, binary sentiment classification, and speech recognition. Results show that, e.g., compared to a recently published work in this field, the proposed accelerator could provide up to 272% higher effective GOPS/W and the perplexity error is reduced by up to 1.4% for the PTB dataset.

研究の動機と目的

  • ハードウェアにやさしいプルーニングを用いて、LSTMニューラルネットワークアクセラレータのエネルギー消費を低減し、速度を向上させること。
  • プルーニングにおけるLSTMの2つの重み行列の感受性の違いに応じ、異なるスパarsity比(二重比スパarsity)を適用することで、その問題を解決すること。
  • プルーニングされた重みに行単位のスパarsityパターンを適用することで、メモリアクセスのオーバーヘッドを最小限に抑えること。
  • 計算オーバーラップとパイプライン処理を活用した、高スループットかつ低消費電力なFPGAベースのアクセラレータを設計すること。
  • 提案手法を自然言語処理、感情分類、音声認識の分野における実世界のベンチマークで評価すること。

提案手法

  • LSTMの2つの重み行列の感受性に応じ、異なるスパarsityレベルを適用する二重比スパarsityを実現するハードウェアにやさしいプルーニングアルゴリズムを開発した。
  • 効率的なメモリアクセスを実現し、ストレージと帯域幅の要件を低減するため、スパarsityを行単位で強制的に適用した。
  • パイプライン処理と計算オーバーラップを活用することで、スループットを最大化し、遅延を最小限に抑えるFPGAベースのアクセラレータアーキテクチャを採用した。
  • FPGAに最適化された設計により、オンチップメモリと並列処理ユニットを活用して、LSTMにおけるスパース行列-ベクトル乗算を高速化した。
  • 言語モデリングのPTB、バイナリ感情分類、音声認識タスクを含むベンチマークでシステムを評価した。
  • アクセラレータはFPGAプラットフォームに実装され、最近発表された最先端のFPGAベースのLSTMアクセラレータと比較された。

実験結果

リサーチクエスチョン

  • RQ1LSTMの2つの感受性の高い重み行列に独立して二重比スパarsityを適用することで、エネルギー効率と推論精度が向上するか?
  • RQ2FPGAベースのLSTMアクセラレータにおいて、行単位のスパarsity組織化がメモリアクセスとパフォーマンスに与える影響は何か?
  • RQ3FPGAアーキテクチャにおけるパイプライン処理と計算オーバーラップは、スパースLSTM推論におけるスループット向上と消費電力低減にどの程度寄与するか?
  • RQ4行バランスの取れた二重比スパarsityを適用した場合、モデルの精度(例:パープレキシティ)とエネルギー効率のトレードオフはどの程度か?
  • RQ5提案されたアクセラレータは、既存のFPGAベースのLSTMアクセラレータと比較して、性能とエネルギー効率の点でどの程度優れているか?

主な発見

  • 提案されたBRDSアクセラレータは、最近発表されたFPGAベースのLSTMアクセラレータと比較して、最大272%高い有効なGOPSWを達成した。
  • Penn Treebank(PTB)データセットにおいて、ベースラインと比較してパープレキシティ誤差が最大1.4%低減し、推論精度の向上が確認された。
  • 行バランスの取れた二重比スパarsity技術により、2つのLSTM重み行列に高いスパarsityレベルを適用しながらも、モデル精度を効果的に保持できた。
  • FPGAベースの実装により、メモリアクセスの削減と効率的な計算オーバーラップのおかげで顕著なエネルギー節約が達成された。
  • パイプライン処理とスパース行列演算に最適化されたデータフローにより、高いスループットを維持した。
  • 結果から、感受性に配慮したスパarsityと行単位の組織化は、FPGAへのデプロイに適した有効でハードウェアにやさしい手法であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。