Skip to main content
QUICK REVIEW

[論文レビュー] Understanding Reuse, Performance, and Hardware Cost of DNN Dataflows: A Data-Centric Approach Using MAESTRO

Hyoukjun Kwon, Prasanth Chatarasi|arXiv (Cornell University)|May 4, 2018
Parallel Computing and Optimization Techniques参考文献 48被引用数 16
ひとこと要約

本論文は、コンパイラフレンドリーなディレクティブを用いてデータフロー仕様を符号化することで、DNNデータフローにおけるリユース、パフォーマンス、ハードウェアコストを定量化するデータ中心の分析モデルMAESTROを紹介する。480Mの構成において高速かつ正確な設計空間探索を可能にし、1秒あたり0.17Mの設計でパラメータ最適化されたスループットおよびエネルギー効率設計を同定する。DNNアクセラレータの最適パフォーマンスを実現するためのバランスの取れたハードウェアリソース割り当てに関する重要な知見が得られた。

ABSTRACT

The data partitioning and scheduling strategies used by DNN accelerators to leverage reuse and perform staging are known as dataflow, and they directly impact the performance and energy efficiency of DNN accelerator designs. An accelerator microarchitecture dictates the dataflow(s) that can be employed to execute a layer or network. Selecting an optimal dataflow for a layer shape can have a large impact on utilization and energy efficiency, but there is a lack of understanding on the choices and consequences of dataflows, and of tools and methodologies to help architects explore the co-optimization design space. In this work, we first introduce a set of data-centric directives to concisely specify the space of DNN dataflows in a compilerfriendly form. We then show how these directives can be analyzed to infer various forms of reuse and to exploit them using hardware capabilities. We codify this analysis into an analytical cost model, MAESTRO (Modeling Accelerator Efficiency via Spatio-Temporal Reuse and Occupancy), that estimates various cost-benefit tradeoffs of a dataflow including execution time and energy efficiency for a DNN model and hardware configuration. We demonstrate the use of MAESTRO to drive a hardware design space exploration (DSE) experiment, which searches across 480M designs to identify 2.5M valid designs at an average rate of 0.17M designs per second, including Pareto-optimal throughput- and energy-optimized design points.

研究の動機と目的

  • DNNデータフロー選択とそのパフォーマンスおよびエネルギー効率への影響について、構造的かつ定量的な理解の欠如に対処すること。
  • リユースおよびスケジューリング戦略を捉えるコンパイラフレンドリーでデータ中心の表記法を提供すること。
  • さまざまなデータフローおよびハードウェア構成において実行時間、エネルギー効率、ハードウェアコストを推定する分析的コストモデル(MAESTRO)を開発すること。
  • 初期段階での無効な設計の pruning を通じて、スケーラブルで高スループットのDNNアクセラレータの設計空間探索(DSE)を可能にすること。
  • PE数、バッファサイズ、NoC帯域幅のトレードオフを明らかにすることで、マイクロアーキテクチャとデータフローの共同最適化を支援すること。

提案手法

  • DNNデータフローをコンパイラフレンドリーな形式で簡潔に表現するためのデータ中心ディレクティブのセットを導入し、ループタイリング、アンローリング、データマッピングを捉える。
  • これらのディレクティブを分析して、PEおよびオンチップバッファにおける領域的・時間的リユースパターンを推定する。
  • PE数、バッファサイズ、NoC帯域幅などのパrameterを用いて実行時間、エネルギー効率、ハードウェアコストを推定する分析的コストモデルMAESTROを開発する。
  • L1、L2、NoC間のデータ移動を考慮し、タイルサイズおよびネットワークトポロジによる遅延を含む通信オーバーヘッドをモデル化する。
  • 無効な設計を早期に pruning するDSEフレームワークにモデルを統合し、1秒あたり0.17Mの設計で高速な探索を実現する。
  • サイクル単位のシミュレーションおよびEyerissおよびMAERIでの報告済み実行時間と比較してMAESTROを検証し、高い一貫性を示した。

実験結果

リサーチクエスチョン

  • RQ1リユースおよびスケジューリングを捉えるデータ中心ディレクティブを用いて、DNNデータフローを形式的かつ簡潔に指定する方法は何か?
  • RQ2与えられたDNNモデルとハードウェアに対して、さまざまなデータフロー構成における主なパフォーマンスおよびエネルギーのトレードオフは何か?
  • RQ3PE数、バッファサイズ、NoC帯域幅の変化がDNNアクセラレータのスループットおよびエネルギー効率に与える影響は何か?
  • RQ4サイクル単位のシミュレーションなしに、分析的モデルがパフォーマンスおよびコストを正確に予測できるか?
  • RQ5異なるDNNレイヤーにおける最適ハードウェア構成は何か?また、それらは初期レイヤーと後期レイヤーでどのように異なるか?

主な発見

  • MAESTROは実行時間およびエネルギー効率の予測において高い正確性を示し、サイクル単位のシミュレーションおよびEyerissおよびMAERIでの報告済み実行時間と強い一貫性を示した。
  • MAESTROに基づくDSEフレームワークは480Mの設計を探索し、平均して1秒あたり0.17Mの有効な設計を同定した。これにより、スケーラブルな探索が可能になった。
  • スループット最適化設計では、PE、バッファ、NoCのリソースをバランスよく割り当てる必要がある。単独でバッファサイズを増やしてもパフォーマンスやエネルギー効率は向上しない。
  • 空間マルチキャストやリダクションサポートが強いデータフローは、最大47%高いエネルギー消費を示し、顕著なコストトレードオフがあることが判明した。
  • DNNの初期レイヤーと後期レイヤーは、顕著に異なるハードウェア的好みを示し、これにより適応的かつ異種のアクセラレータ設計の必要性が浮き彫りになった。
  • モデルは最適パフォーマンスを達成するにはPE、バッファ、NoCの共同最適化が必要であることを明らかにした。これは、リソース割り当てが、特定のコンponentに偏ることなくバランスが取られていなければならないことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。