[論文レビュー] Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
この論文では、異種のマルチコアアクセラレータ上でレイヤー融合DNNの設計空間探索を可能にするオープンソースフレームワークであるStreamを紹介する。異なるハードウェアアーキテクチャにわたる細粒度で深さ優先のスケジューリングを可能にし、従来のレイヤー単位のスケジューリングと比較して、エネルギー遅延積(EDP)を最大30倍まで低減する。
As the landscape of deep neural networks evolves, heterogeneous dataflow accelerators, in the form of multi-core architectures or chiplet-based designs, promise more flexibility and higher inference performance through scalability. So far, these systems exploit the increased parallelism by coarsely mapping a single layer at a time across cores, which incurs frequent costly off-chip memory accesses, or by pipelining batches of inputs, which falls short in meeting the demands of latency-critical applications. To alleviate these bottlenecks, this work explores a new fine-grain mapping paradigm, referred to as layer fusion, on heterogeneous dataflow accelerators through a novel design space exploration framework called Stream. Stream captures a wide variety of heterogeneous dataflow architectures and mapping granularities, and implements a memory and communication-aware latency and energy analysis validated with three distinct state-of-the-art hardware implementations. As such, it facilitates a holistic exploration of architecture and mapping, by strategically allocating the workload through constraint optimization. The findings demonstrate that the integration of layer fusion with heterogeneous dataflow accelerators yields up to 2.2x lower energy-delay product in inference efficiency, addressing both energy consumption and latency concerns. The framework is available open-source at: https://github.com/kuleuven-micas/stream.
研究の動機と目的
- 遅延が厳しい、リソースが制限されたエッジDNN推論における従来のレイヤー単位スケジューリングの非効率性を解消すること。
- レイヤー融合DNNのスケジューリング粒度とハードウェアアーキテクチャのトレードオフを体系的かつ包括的に探索すること。
- 多様なマルチコアアクセラレータ設計におけるスケジューリングの評価と最適化を可能にする汎用的でオープンソースのモデリングフレームワークを提供すること。
- アーキテクチャの非均一性と細粒度スケジューリングがエネルギー、遅延、メモリ効率に与える影響を定量化すること。
提案手法
- 複数のスケジューリング粒度とハードウェアアーキテクチャにわたるレイヤー融合DNNの統一されたモデリング表現を構築した。
- 融合ネットワークにおける複雑なレイヤー間およびレイヤー内依存関係をモデル化するための高速な細粒度データ依存関係生成器を実装した。
- 最適な処理コアへの融合レイヤーのマッピングを実現する遺伝的アルゴリズムに基づくレイヤー・コアアロケータを採用した。
- エネルギー、遅延、またはメモリフットプリントを最小化する実行シーケンスを生成するヒューリスティクスベースのスケジューラを統合した。
- 測定された効率データを用いて、3つの最先端のハードウェアアクセラレータに対してフレームワークの妥当性を検証した。
- 7つのハードウェアアーキテクチャと5つのDNNを対象に大規模な設計空間探索を実施し、最適なスケジューリングとアーキテクチャの組み合わせを同定した。
実験結果
リサーチクエスチョン
- RQ1レイヤー融合DNNの細粒度で深さ優先のスケジューリングは、従来のレイヤー単位スケジューリングと比較して、エネルギー、遅延、メモリ効率にどのような影響を与えるか?
- RQ2単一コア、均一なマルチコア、非均一なマルチコアといったハイレベルなアーキテクチャ選択は、レイヤー融合DNNの実行効率にどの程度影響を与えるか?
- RQ3汎用的なモデリングフレームワークは、多様なアクセラレータ設計とスケジューリング粒度の間で、ハードウェア効率を正確に予測できるか?
- RQ4スケジューリングとハードウェアアーキテクチャの共同最適化によって、エネルギー遅延積(EDP)は最大どれほど低減可能か?
主な発見
- Streamは、レイヤー融合スケジューリングを用いた3つの最先端ハードウェア実装と比較して、測定値と5%以内の高い一致を達成した。
- 単一コアアーキテクチャでは、レイヤー融合によりレイヤー単位スケジューリングと比較してエネルギー遅延積(EDP)が2.4倍から4.7倍まで低減した。
- 均一なマルチコアアーキテクチャでは、レイヤー融合によりレイヤー単位スケジューリングと比較してEDPが10倍から19倍まで改善された。
- 非均一なマルチコアアーキテクチャでは、レイヤー単位スケジューリングと比較してEDPが最大30.4倍まで低減され、最良の均一設計をも上回った。
- 非均一アーキテクチャは、多様なレイヤー種別を持つネットワークに対して最大の利点を示したが、SqueezeNetのような均一なネットワークでは、改善が限定的または性能劣化を引き起こす場合もあった。
- 遺伝的アルゴリズムに基づくレイヤー・コアアロケータは、手動アロケーションを著しく上回り、遅延とメモリフットプリントを削減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。