Skip to main content
QUICK REVIEW

[論文レビュー] DNNExplorer: A Framework for Modeling and Exploring a Novel Paradigm of FPGA-based DNN Accelerator

Xiaofan Zhang, Hanchen Ye|arXiv (Cornell University)|Aug 28, 2020
Embedded Systems Design Techniques参考文献 34被引用数 15
ひとこと要約

DNNExplorerは、高性能、特定性、スケーラビリティを実現するため、専用パイプライン段階と再利用可能な計算ユニットを組み合わせた、FPGAベースのDNNアクセラレータ設計パラダイムを導入するフレームワークである。動的設計空間と二段階の設計空間探索(DSE)エンジンを活用することで、最先端のDNNBuilderソリューションよりも最大4.2倍高いスループット(GOP/s)と、商用Xilinx DPUよりも最大4.4倍高いDSP効率を達成する最適化されたアクセラレータを生成する。

ABSTRACT

Existing FPGA-based DNN accelerators typically fall into two design paradigms. Either they adopt a generic reusable architecture to support different DNN networks but leave some performance and efficiency on the table because of the sacrifice of design specificity. Or they apply a layer-wise tailor-made architecture to optimize layer-specific demands for computation and resources but loose the scalability of adaptation to a wide range of DNN networks. To overcome these drawbacks, this paper proposes a novel FPGA-based DNN accelerator design paradigm and its automation tool, called DNNExplorer, to enable fast exploration of various accelerator designs under the proposed paradigm and deliver optimized accelerator architectures for existing and emerging DNN networks. Three key techniques are essential for DNNExplorer's improved performance, better specificity, and scalability, including (1) a unique accelerator design paradigm with both high-dimensional design space support and fine-grained adjustability, (2) a dynamic design space to accommodate different combinations of DNN workloads and targeted FPGAs, and (3) a design space exploration (DSE) engine to generate optimized accelerator architectures following the proposed paradigm by simultaneously considering both FPGAs' computation and memory resources and DNN networks' layer-wise characteristics and overall complexity. Experimental results show that, for the same FPGAs, accelerators generated by DNNExplorer can deliver up to 4.2x higher performances (GOP/s) than the state-of-the-art layer-wise pipelined solutions generated by DNNBuilder for VGG-like DNN with 38 CONV layers. Compared to accelerators with generic reusable computation units, DNNExplorer achieves up to 2.0x and 4.4x DSP efficiency improvement than a recently published accelerator design from academia (HybridDNN) and a commercial DNN accelerator IP (Xilinx DPU), respectively.

研究の動機と目的

  • 既存のFPGAベースのDNNアクセラレータが再利用性を犠牲にして性能を落とす、あるいはスケーラビリティを犠牲にして特定性を失うという限界を解消すること。
  • 多様なDNNモデルにわたる細かいカスタマイズとスケーラビリティの両立を可能にする、新しいアクセラレータ設計パラダイムを提案すること。
  • 新しいパラダイムに従い、高次元設計空間を素早くかつ効率的に探索できる自動化されたフレームワーク、DNNExplorerを開発すること。
  • FPGAリソース制約(DSP、BRAM)とDNNレイヤー特性(計算対通信比、複雑さ)の両方を同時に最適化すること。
  • 既存および将来の深層ニューラルネットワークワークロードに対応する最適化されたアプリケーション固有のアクセラレータアーキテクチャを提供すること。

提案手法

  • 高計算量レイヤーに特化したパイプライン段階と、低計算量レイヤーに再利用可能なユニットを組み合わせたハイブリッドアクセラレータ設計パラダイムを導入し、性能とスケーラビリティの両立を実現する。
  • アクセラレータパラメータの詳細な設定を捉える動的設計空間を定義し、異なるDNNモデルとFPGAプラットフォームにおけるタスク分割、リソース割り当て、バッチサイズを含む。
  • 二段階のDSEエンジンを採用:グローバルサーチで高レベルなアーキテクチャ意思決定を行い、ローカルサーチで微調整を実施。効率性を向上させるために早期終了を実装。
  • パフォーマンスモデリングを用いて、レイヤー単位のDNN特性とFPGA制約に基づき、スループットとリソース利用率を予測する。
  • ハードウェアリソース制限とDNNワークロード要件の両方に従って、反復的な探索によって最適化されたアクセラレータ構成を自動生成する。
  • 高次元設計空間を効率的に管理するため、DSEプロセスにおいて分割統治戦略を採用し、標準CPU上でも数分以内の探索時間で最適化構成を達成する。

実験結果

リサーチクエスチョン

  • RQ1専用パイプラインと再利用可能なユニットを組み合わせたハイブリッドFPGAアクセラレータは、スループットと効率性において、従来の汎用的またはレイヤー単位パイプライン化されたパラダイムを上回ることができるか?
  • RQ2多様なDNNモデルとFPGAプラットフォームにわたるアクセラレータパラメータの細かい設定を可能にするために、どのように動的設計空間を定義できるか?
  • RQ3FPGAリソース制約を満たしつつパフォーマンスを最大化するため、高次元設計空間を効率的に探索できる二段階DSEエンジンの限界はどこか?
  • RQ4より深いDNN(畳み込み層の数が多いもの)をターゲットにした場合、提案フレームワークはどの程度スケーリングできるか?
  • RQ5DNNBuilder、HybridDNN、Xilinx DPUといった最先端のDNNアクセラレータと比較して、どのようなパフォーマンスおよび効率性の向上が達成できるか?

主な発見

  • 38層のVGGに類似したDNNにおいて、DNNExplorerが生成したアクセラレータは、同じXilinx KU115 FPGA上で、最先端のDNNBuilderソリューションに比べ最大4.2倍高いスループット(GOP/s)を達成した。
  • 汎用的なHybridDNNアクセラレータと比較して、DNNExplorerは、小さな入力サイズでは最大2.0倍、大きな入力サイズでは最大1.3倍のDSP効率向上を達成した。
  • 商用Xilinx DPU IPと比較すると、ZCU102 FPGA上での平均DSP効率が1.6倍高く、最小の入力サイズでは最大4.4倍の向上を示した。
  • DNNExplorerのDSEエンジンは、12種類の異なる入力サイズと変動するバッチサイズを含む高次元設計空間においても、平均して数分で最適化された構成を生成した。
  • 深層ネットワークに対しても優れたパフォーマンスを維持した。38層のモデルでは、DNNBuilderに比べスループットで4.2倍の向上を示し、強力なスケーラビリティを示した。
  • 入力サイズが変化してもスループットが一貫して高く維持され、入力サイズが大きくなってもパフォーマンス低下が最小限に抑えられ、耐障害性と適応性の高さが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。