Skip to main content
QUICK REVIEW

[論文レビュー] An Efficient Hardware Accelerator for Structured Sparse Convolutional Neural Networks on FPGAs

Chaoyang Zhu, Kejie Huang|arXiv (Cornell University)|Jan 7, 2020
Advanced Neural Network Applications参考文献 36被引用数 8
ひとこと要約

本論文は、ゼロ重みのMAC演算をスキップし、ゼロゲーティングを用いてエネルギー消費を低減するスパースワイズデータフローを用いたFPGA上での構造的スパース畳み込みニューラルネットワーク用ハードウェアアクセラレータを提案する。この設計は、Xilinx ZCU102上でAlexNetに対して987画像/秒、VGG-16に対して48画像/秒を達成し、先行のFPGAアクセラレータと比較して1.5×から6.7×の高速化と2.0×から6.2×の高いエネルギー効率を実現した。

ABSTRACT

Deep Convolutional Neural Networks (CNNs) have achieved state-of-the-art performance in a wide range of applications. However, deeper CNN models, which are usually computation consuming, are widely required for complex Artificial Intelligence (AI) tasks. Though recent research progress on network compression such as pruning has emerged as a promising direction to mitigate computational burden, existing accelerators are still prevented from completely utilizing the benefits of leveraging sparsity owing to the irregularity caused by pruning. On the other hand, Field-Programmable Gate Arrays (FPGAs) have been regarded as a promising hardware platform for CNN inference acceleration. However, most existing FPGA accelerators focus on dense CNN and cannot address the irregularity problem. In this paper, we propose a sparse wise dataflow to skip the cycles of processing Multiply-and-Accumulates (MACs) with zero weights and exploit data statistics to minimize energy through zeros gating to avoid unnecessary computations. The proposed sparse wise dataflow leads to a low bandwidth requirement and a high data sharing. Then we design an FPGA accelerator containing a Vector Generator Module (VGM) which can match the index between sparse weights and input activations according to the proposed dataflow. Experimental results demonstrate that our implementation can achieve 987 imag/s and 48 imag/s performance for AlexNet and VGG-16 on Xilinx ZCU102, respectively, which provides 1.5x to 6.7x speedup and 2.0x to 6.2x energy-efficiency over previous CNN FPGA accelerators.

研究の動機と目的

  • 剪定されたCNNからの不規則なスパarsityを処理する際の既存FPGAアクセラレータの非効率性を解消すること。
  • 密なCNNアクセラレータの制限を超えて、構造的スパarsityを活用することでスパース推論における性能を向上させること。
  • ゼロゲーティングによる動的消費電力の低減と、スパース計算におけるデータ共有による帯域幅の削減を通じて、エネルギー消費を最小限に抑えること。
  • さまざまなCNNモデルのサイズとスパarsityパターンに適応可能な柔軟でリソース効率の高いアクセラレータを設計すること。
  • データフロー最適化とハードウェアに配慮したスパarsityの活用により、FPGA上で高い性能とエネルギー効率を達成すること。

提案手法

  • ゼロ重みを有するMAC演算をスキップするスパースワイズデータフローを提案し、座標再構築の必要性を排除する。
  • 提案されたデータフローを用いて、スパース重みと入力活性化を効率的にマッピングするためのベクタジェネレータモジュール(VGM)を導入する。
  • 入力活性化がゼロの場合に使用されないPEを無効化するゼロゲーティング論理を実装し、動的消費電力を低減する。
  • 1回のDDRアクセスあたりのデータスループットを2倍にするために8ビット固定小数点量子化を採用し、リソース効率を向上させる。
  • 計算強度とオンチップメモリ制約の両立を図るため、サイズを設定可能なPEアレイ(例:48×28 PEs)を設計する。
  • ルーフラインモデリングを適用し、ピーク性能とエネルギー効率を達成する最適な設定を同定する。

実験結果

リサーチクエスチョン

  • RQ1不規則なスパarsityに起因するオーバーヘッドを回避しつつ、CNNにおける構造的スパarsityを効率的に処理するデータフローはどのように設計できるか?
  • RQ2FPGA上でのスパースCNN推論において、エネルギー消費を最小限に抑えるためにどのようなアーキテクチャ的技術が有効か?
  • RQ3提案されたデータフローは、既存のFPGAアクセラレータ(スパースおよび密なCNN用)と比較して、性能とエネルギー効率でどの程度優れているか?
  • RQ4データフローと量子化最適化によって、リソース効率とスループットはどの程度向上できるか?
  • RQ5FPGA上で高い性能とエネルギー効率を達成するためのPEアレイサイズとビット幅の最適な設定は何か?

主な発見

  • 提案されたアクセラレータは、Xilinx ZCU102上で構造的スパースAlexNetに対して987画像/秒を達成し、先行のFPGAアクセラレータと比較して1.5×から6.7×の高速化を実現した。
  • VGG-16では48画像/秒を達成し、先行研究と比較して2.2×から2.3×の高速化と3.4×から6.2×の高いエネルギー効率を示した。
  • 8ビット量子化を用いることで、アクセラレータは96画像/秒を達成し、密およびスパースFPGAアクセラレータと比較して4.4×から4.6×の高速化と6.1×から11.2×のエネルギー効率向上を達成した。
  • 8ビット演算を用いることで、1PEあたり2つの8×8乗算を2つのDSPで実行できるため、ピークスループットは1075.2 GOP/sに達した。
  • 48×28の構成で1344 PEsを実装し、AlexNetでは8 PEsを超えると、VGG-16では16 PEsを超えると帯域幅とリソース制限により性能が頭打ちとなった。
  • 8ビットデータを用いることで、LUTおよびマルチプレクサの使用が削減されたため、論理セル効率が先行設計と比較してほぼ100倍向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。