Skip to main content
QUICK REVIEW

[論文レビュー] DNA: Differentiable Network-Accelerator Co-Search

Yong‐An Zhang, Yonggan Fu|arXiv (Cornell University)|Oct 28, 2020
Advanced Neural Network Applications参考文献 43被引用数 16
ひとこと要約

DNAは、最大の精度とハードウェア効率を実現するため、DNNアーキテクチャとアクセラレータマイクロアーキテクチャを共同で最適化する微分可能ネットワークアクセラレータ共同探索フレームワークを提案する。汎用アクセラレータ設計空間と微分可能アクセラレータ探索エンジンを統合することで、SOTAと比較して最大3.04倍のFPS向上と5.46%のImageNet精度向上を達成するとともに、探索時間を最大1234.3倍短縮した。

ABSTRACT

Powerful yet complex deep neural networks (DNNs) have fueled a booming demand for efficient DNN solutions to bring DNN-powered intelligence into numerous applications. Jointly optimizing the networks and their accelerators are promising in providing optimal performance. However, the great potential of such solutions have yet to be unleashed due to the challenge of simultaneously exploring the vast and entangled, yet different design spaces of the networks and their accelerators. To this end, we propose DNA, a Differentiable Network-Accelerator co-search framework for automatically searching for matched networks and accelerators to maximize both the task accuracy and acceleration efficiency. Specifically, DNA integrates two enablers: (1) a generic design space for DNN accelerators that is applicable to both FPGA- and ASIC-based DNN accelerators and compatible with DNN frameworks such as PyTorch to enable algorithmic exploration for more efficient DNNs and their accelerators; and (2) a joint DNN network and accelerator co-search algorithm that enables simultaneously searching for optimal DNN structures and their accelerators' micro-architectures and mapping methods to maximize both the task accuracy and acceleration efficiency. Experiments and ablation studies based on FPGA measurements and ASIC synthesis show that the matched networks and accelerators generated by DNA consistently outperform state-of-the-art (SOTA) DNNs and DNN accelerators (e.g., 3.04x better FPS with a 5.46% higher accuracy on ImageNet), while requiring notably reduced search time (up to 1234.3x) over SOTA co-exploration methods, when evaluated over ten SOTA baselines on three datasets. All codes will be released upon acceptance.

研究の動機と目的

  • 膨大で複雑に絡み合った設計空間において、DNNとそのアクセラレータを共同で最適化する課題に対処すること。
  • 共同最適化における非微分可能ハードウェアコストと疎な最適解の制限を克服すること。
  • FPGAおよびASICベースのアクセラレータと両立可能なスケーラブルで汎用的なアクセラレータ探索空間の開発。
  • 微分可能探索による勾配ベースの効率的で、DNNとアクセラレータの共同設計を実現すること。
  • エキスパート設計やツール生成のSOTAアクセラレータを上回る精度とスループットを達成しながら、探索時間を短縮すること。

提案手法

  • FPGAおよびASICベースのアクセラレータに適用可能な汎用DNNアクセラレータ設計空間(GADS)を導入し、マイクロアーキテクチャとマッピング手法のアルゴリズム的探索を可能にする。
  • 強化学習ベースの手法よりも効率的に大規模で離散的なアクセラレータ設計空間を走破できる勾配ベースの探索エンジン「微分可能アクセラレータ探索(DAS)」を開発する。
  • 精度とハードウェア効率の両面で最適化するため、DNN構造とアクセラレータ設定を同時に最適化する共同微分可能共同探索アルゴリズムを採用する。
  • 離散的なアーキテクチャ的選択をバックプロパゲーション可能にするために微分可能演算を用い、ネットワークとアクセラレータのエンドツーエンド最適化を可能にする。
  • PyTorchとの統合を支援し、アクセラレータパラメータの微分可能探索により、ハードウェアに配慮したニューラルアーキテクチャ探索を実現する。
  • FPGA測定値とASIC合成を用いて検証を行い、探索空間のサンプリングとアブレーションスタディを通じて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1微分可能共同探索フレームワークは、精度とハードウェア効率の両方を最大化するため、DNNアーキテクチャとアクセラレータマイクロアーキテクチャを共同で最適化できるか?
  • RQ2提案された微分可能アクセラレータ探索(DAS)エンジンは、大規模で離散的なアクセラレータ設計空間を走破するにあたり、強化学習ベースやランダム探索と比較してどのように優れているか?
  • RQ3汎用アクセラレータ設計空間(GADS)は、スケーラブルでハードウェアに依存しないDNNとアクセラレータの共同設計をどの程度可能にするか?
  • RQ4DNAの共同最適化戦略は、探索時間を短縮しながら、SOTA手法を上回る精度とスループットを達成するか?
  • RQ5DNAが生成するネットワークとアクセラレータで顕在化するアーキテクチャ的パターンは何か? それらは効率性と精度にどのように寄与するか?

主な発見

  • DNAが生成したネットワークとアクセラレータは、ZC706 FPGA上でImageNetで75.6%のトップ-1精度と42 FPSを達成し、SOTAのDNNとアクセラレータを上回った。
  • DNAは、ImageNetにおいてSOTAと比較して最大3.04倍のスループット向上と5.46%の精度向上を達成するとともに、探索時間を最大1234.3倍短縮した。
  • 同じFPGAと精度制約下で、VGG16のスループットにおいてDASエンジンはSOTAアクセラレータを最大2.12倍向上させた。
  • DNAが生成したアクセラレータは、レイヤー固有の次元に適応するチャンクベースのパイプラインアーキテクチャを採用しており、初期レイヤーでは空間次元の並列処理を、深く層が進むとチャネルレベルの並列処理を実装している。
  • 共同探索フレームワークは、幅広くスキップ接続を持つアーキテクチャを好むネットワークを発見し、深さを犠牲にして幅を増やすことで、精度とハードウェア効率の両方を向上させた。
  • アブレーションスタディにより、DASは探索効率と最終的なパフォーマンスの両面で、ランダム探索や強化学習ベースの手法を顕著に上回ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。