Skip to main content
QUICK REVIEW

[論文レビュー] HERALD: Optimizing Heterogeneous DNN Accelerators for Edge Devices.

Hyoukjun Kwon, Liangzhen Lai|arXiv (Cornell University)|Sep 13, 2019
Advanced Neural Network Applications参考文献 33被引用数 13
ひとこと要約

HERALD は、エネルギー遅延積(EDP)を最小化するために、異種DNNアクセラレータ(HDA)のハードウェアパーティショニングとレイヤースケジューリングを共同で最適化するフレームワークである。DNNレイヤーの依存グラフ構造を活用することで、最適化の複雑さを低減し、さまざまなワークロードとアクセラレータ構成において、モノリシックアクセラレータよりも平均で56.0%のEDP向上を達成した。

ABSTRACT

New real time applications such as virtual reality (VR) with multiple sub-tasks (e.g., image segmentation, hand tracking, etc.) based on deep neural networks (DNNs) are emerging. Such applications rely on multiple DNNs for each sub-task with heterogeneity and require to meet target processing rates for each sub-task. Thus, the new compound DNN workload imposes new challenges to accelerator designs in two folds: (1) meeting target processing rate for each DNN for sub-tasks and (2) efficiently processing heterogeneous layers. As a solution, we explore heterogeneous DNN accelerators (HDAs). HDAs consist of multiple accelerator substrates (i.e., sub-accelerators) to support model parallelism that implements different mapping styles to provide adaptivity to heterogeneous DNN layers. However, HDA's performance and energy heavily depend on (1) how we partition hardware resources for sub-accelerators, and (2) how we schedule layers on the sub-accelerators. Therefore, we propose an HDA optimization framework, Herald, which performs co-optimization of hardware partitioning and layer schedluing. Herald exploits the simplicity of dependence graph of DNN layers to reduce the complexity of the problem, which on average requires 9.48 ms per layer on a laptop with i9-9880H processor and 16GB memory. Herald can be utilized both in design time to perform co-optimization (optimizer) and in compile time to perform layer scheduling and report expected latency and energy (cost model/scheduler). In our case studies, co-optimized HDAs with the best EDP Herald identified provided 56.0% EDP improvements with 46.82% latency and 6.3% energy benefits on average across workloads and accelerators we evaluate compared to the best monolithic accelerators for each evaluation setting by deploying two complementary-style sub-accelerators in an HDA.

研究の動機と目的

  • VRなどのリアルタイムエッジアプリケーションにおける、サブタスクを含む複数の異種DNNのターゲット処理レートを満たす課題に対処する。
  • 異種DNNレイヤーを処理する際のモノリシックアクセラレータの性能およびエネルギー非効率性を克服する。
  • 異種DNNアクセラレータ(HDA)におけるハードウェアリソースパーティショニングとレイヤースケジューリングを共同最適化し、エネルギー遅延積(EDP)を改善する。
  • 軽量なコストモデルを介して、コンpilation時スケジューリングと遅延/エネルギー推定を可能にする。

提案手法

  • HDA向けに、サブアクセラレータリソースの割り当てとレイヤースケジューリングを共同で決定するフレームワーク、HERALDを提案する。
  • DNNレイヤーの依存グラフの単純さを活用し、最適化問題の計算複雑性を低減する。
  • 最小EDPを達成するための、設計時最適化ツールを実装し、ハードウェアパーティショニングとスケジューリングを共同最適化する。
  • HERALDの共同最適化構成に基づいて、遅延とエネルギーを予測するコンパイル時コストモデルおよびスケジューラを開発する。
  • ラップトップベースのプロトタイプを用いて最適化のオーバーヘッドを評価し、平均で1レイヤーあたり9.48 msを達成した。

実験結果

リサーチクエスチョン

  • RQ1エッジデバイス向けの異種DNNアクセラレータにおいて、EDPを最小化するために、ハードウェアパーティショニングとレイヤースケジューリングをどのように共同最適化できるか?
  • RQ2モノリシック設計と比較して、補完的スタイルのサブアクセラレータを用いることで、パフォーマンスとエネルギー効率にどのような影響があるか?
  • RQ3多様なDNNワークロードとアクセラレータ構成にわたって、最適化フレームワークはどの程度効率的にスケーリングできるか?
  • RQ4時間的およびリソース使用量の観点から、共同最適化プロセスの計算オーバーヘッドはどの程度か?

主な発見

  • HERALD は、評価されたワークロードと構成すべてにおいて、最良のモノリシックアクセラレータと比較して平均EDPを56.0%削減した。
  • 共同最適化されたHDAは、平均遅延を46.82%削減し、平均エネルギー消費量を6.3%削減した。
  • 最適化プロセスは、標準ラップトップ上で1レイヤーあたり平均9.48 msで実行され、設計時用途において実用的である。
  • フレームワークは、コストモデルとスケジューラを介して、正確なコンパイル時遅延およびエネルギー予測を可能にした。
  • HDAに2つの補完的スタイルのサブアクセラレータを用いることで、異種DNNレイヤーに対する適応性と効率性が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。