[論文レビュー] SparseNN: An Energy-Efficient Neural Network Accelerator Exploiting Input and Output Sparsity
SparseNNは、エンドツーエンドで訓練されたスパarsity予測子を用いて、入力および出力活性化のスパarsityを統合的に活用する、エネルギー効率に優れたDNNアクセラレータを提案する。出力スパarsityを5%未満の計算オーバーヘッドで予測することで、入力スパarsityのみを活用する最先端のアクセラレータと比較して、スループットは10–70%向上し、消費電力は50%低減する。
Contemporary Deep Neural Network (DNN) contains millions of synaptic connections with tens to hundreds of layers. The large computation and memory requirements pose a challenge to the hardware design. In this work, we leverage the intrinsic activation sparsity of DNN to substantially reduce the execution cycles and the energy consumption. An end-to-end training algorithm is proposed to develop a lightweight run-time predictor for the output activation sparsity on the fly. From our experimental results, the computation overhead of the prediction phase can be reduced to less than 5% of the original feedforward phase with negligible accuracy loss. Furthermore, an energy-efficient hardware architecture, SparseNN, is proposed to exploit both the input and output sparsity. SparseNN is a scalable architecture with distributed memories and processing elements connected through a dedicated on-chip network. Compared with the state-of-the-art accelerators which only exploit the input sparsity, SparseNN can achieve a 10%-70% improvement in throughput and a power reduction of around 50%.
研究の動機と目的
- 組み込みシステムにおける深層ニューラルネットワーク(DNN)の高いエネルギーおよびメモリ要件に対処する。
- 従来のアクセラレータが入力スパarsityのみを活用するという制限を克服する。
- 最小限の計算オーバーヘッドで出力活性化スパarsityを実行時予測するための予測子を開発する。
- 入力および出力スパarsityを効率的に活用できるスケーラブルなNoCベースのハードウェアアーキテクチャ(SparseNN)を設計する。
- 既存のSIMDおよびEIEスタイルのアクセラレータと比較して、スループットおよびエネルギー効率に顕著な向上を示す。
提案手法
- バックプロパゲーションを用いて出力スパarsity予測のためのUおよびV行列を学習するエンドツーエンド訓練アルゴリズムを提案する。
- フィードフォワード段階におけるオーバーヘッドが5%未満となるように、切り捨てられた特異値分解(SVD)に類似した分解を用いて、実際の計算の前に出力スパarsityを予測する。
- 分散型プロセッシングエレメント(PE)およびメモリを備えたスケーラブルなネットワークオンチップ(NoC)アーキテクチャを設計し、高い並列性を実現する。
- スパarsityに配慮したメモリアクセスおよび計算スケジューリングを統合し、入力および出力特徴マップのゼロ活性化をバイパスする。
- 65nmプロセスを用いてASICにSparseNNを実装し、重み(W)用のオンチップSRAMおよびスパarsity予測用の補助行列(U, V)を搭載する。
- PEおよびメモリを接続する専用オンチップネットワークを採用し、通信ボトル neck を低減するとともに、スケーラビリティを実現する。
実験結果
リサーチクエスチョン
- RQ1出力活性化のためのエンドツーエンドで訓練されたスパarsity予測子を、最小限の計算オーバーヘッドで設計可能か?
- RQ2入力および出力スパarsityを併用して活用することで、DNN推論におけるスループットおよびエネルギー効率にどのような影響を与えるか?
- RQ3スケーラブルなNoCベースのハードウェアアーキテクチャは、入力および出力スパarsityの両方の活用を効率的にサポートできるか?
- RQ4EIEやLRADNNのような最先端のアクセラレータと比較して、SparseNNの性能およびエネルギー効率の向上はどの程度か?
- RQ5異なるネットワークランクおよびDNNモデルにおけるスパarsity予測の精度およびスケーラビリティはどのように変化するか?
主な発見
- スパarsity予測フェーズは、元のフィードフォワードパスに5%未満の計算オーバーヘッドを追加するが、精度損失は無視できるほど小さい。
- 入力スパarsityのみを活用するアクセラレータと比較して、SparseNNは層およびデータセットに応じて10–70%のスループット向上を達成する。
- 入力および出力スパarsityの両方を活用することで、メモリアクセスの削減および低消費電力のスパarsity予測のおかげで、消費電力が約50%低減される。
- 面積構成比では、全面積の94.8%がメモリ(主にW、U、V行列用のオンチップSRAM)が占められ、PEはメモリ面積の99.2%を占める。
- 28nmのSIMDアーキテクチャ(DNN-Engine)を65nmにスケーリングした場合、SparseNNは有効なスパarsity活用のおかげで4倍のエネルギー効率を達成する。
- 実行サイクルの短縮効果は、特に深い層で顕著であり(最大70%の削減)、前段の層からの出力スパarsity予測が、次世代の層における入力スパarsityを向上させる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。