Skip to main content
QUICK REVIEW

[論文レビュー] SparseNN: An Energy-Efficient Neural Network Accelerator Exploiting Input and Output Sparsity

Jingyang Zhu, Jingbo Jiang|arXiv (Cornell University)|Nov 3, 2017
Advanced Neural Network Applications参考文献 14被引用数 3
ひとこと要約

SparseNNは、エンドツーエンドで訓練されたスパarsity予測子を用いて、入力および出力活性化のスパarsityを統合的に活用する、エネルギー効率に優れたDNNアクセラレータを提案する。出力スパarsityを5%未満の計算オーバーヘッドで予測することで、入力スパarsityのみを活用する最先端のアクセラレータと比較して、スループットは10–70%向上し、消費電力は50%低減する。

ABSTRACT

Contemporary Deep Neural Network (DNN) contains millions of synaptic connections with tens to hundreds of layers. The large computation and memory requirements pose a challenge to the hardware design. In this work, we leverage the intrinsic activation sparsity of DNN to substantially reduce the execution cycles and the energy consumption. An end-to-end training algorithm is proposed to develop a lightweight run-time predictor for the output activation sparsity on the fly. From our experimental results, the computation overhead of the prediction phase can be reduced to less than 5% of the original feedforward phase with negligible accuracy loss. Furthermore, an energy-efficient hardware architecture, SparseNN, is proposed to exploit both the input and output sparsity. SparseNN is a scalable architecture with distributed memories and processing elements connected through a dedicated on-chip network. Compared with the state-of-the-art accelerators which only exploit the input sparsity, SparseNN can achieve a 10%-70% improvement in throughput and a power reduction of around 50%.

研究の動機と目的

  • 組み込みシステムにおける深層ニューラルネットワーク(DNN)の高いエネルギーおよびメモリ要件に対処する。
  • 従来のアクセラレータが入力スパarsityのみを活用するという制限を克服する。
  • 最小限の計算オーバーヘッドで出力活性化スパarsityを実行時予測するための予測子を開発する。
  • 入力および出力スパarsityを効率的に活用できるスケーラブルなNoCベースのハードウェアアーキテクチャ(SparseNN)を設計する。
  • 既存のSIMDおよびEIEスタイルのアクセラレータと比較して、スループットおよびエネルギー効率に顕著な向上を示す。

提案手法

  • バックプロパゲーションを用いて出力スパarsity予測のためのUおよびV行列を学習するエンドツーエンド訓練アルゴリズムを提案する。
  • フィードフォワード段階におけるオーバーヘッドが5%未満となるように、切り捨てられた特異値分解(SVD)に類似した分解を用いて、実際の計算の前に出力スパarsityを予測する。
  • 分散型プロセッシングエレメント(PE)およびメモリを備えたスケーラブルなネットワークオンチップ(NoC)アーキテクチャを設計し、高い並列性を実現する。
  • スパarsityに配慮したメモリアクセスおよび計算スケジューリングを統合し、入力および出力特徴マップのゼロ活性化をバイパスする。
  • 65nmプロセスを用いてASICにSparseNNを実装し、重み(W)用のオンチップSRAMおよびスパarsity予測用の補助行列(U, V)を搭載する。
  • PEおよびメモリを接続する専用オンチップネットワークを採用し、通信ボトル neck を低減するとともに、スケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ1出力活性化のためのエンドツーエンドで訓練されたスパarsity予測子を、最小限の計算オーバーヘッドで設計可能か?
  • RQ2入力および出力スパarsityを併用して活用することで、DNN推論におけるスループットおよびエネルギー効率にどのような影響を与えるか?
  • RQ3スケーラブルなNoCベースのハードウェアアーキテクチャは、入力および出力スパarsityの両方の活用を効率的にサポートできるか?
  • RQ4EIEやLRADNNのような最先端のアクセラレータと比較して、SparseNNの性能およびエネルギー効率の向上はどの程度か?
  • RQ5異なるネットワークランクおよびDNNモデルにおけるスパarsity予測の精度およびスケーラビリティはどのように変化するか?

主な発見

  • スパarsity予測フェーズは、元のフィードフォワードパスに5%未満の計算オーバーヘッドを追加するが、精度損失は無視できるほど小さい。
  • 入力スパarsityのみを活用するアクセラレータと比較して、SparseNNは層およびデータセットに応じて10–70%のスループット向上を達成する。
  • 入力および出力スパarsityの両方を活用することで、メモリアクセスの削減および低消費電力のスパarsity予測のおかげで、消費電力が約50%低減される。
  • 面積構成比では、全面積の94.8%がメモリ(主にW、U、V行列用のオンチップSRAM)が占められ、PEはメモリ面積の99.2%を占める。
  • 28nmのSIMDアーキテクチャ(DNN-Engine)を65nmにスケーリングした場合、SparseNNは有効なスパarsity活用のおかげで4倍のエネルギー効率を達成する。
  • 実行サイクルの短縮効果は、特に深い層で顕著であり(最大70%の削減)、前段の層からの出力スパarsity予測が、次世代の層における入力スパarsityを向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。