Skip to main content
QUICK REVIEW

[論文レビュー] Fluid Batching: Exit-Aware Preemptive Serving of Early-Exit Neural Networks on Edge NPUs

Alexandros Kouris, Stylianos I. Venieris|arXiv (Cornell University)|Sep 27, 2022
Age of Information Optimization被引用数 6
ひとこと要約

本稿では、エッジNPU向けにハードウェア・ソフトウェア共同設計されたフレームワーク「Fluid Batching」を提案する。このフレームワークにより、エアリー・エグジットニューラルネットワークのエグジット対応で事前割り当て可能なバッチ処理が可能となり、動的にバッチ戦略を適応させるとともにスタック可能な処理素子を活用することで、最先端のシステムと比較して平均遅延が1.97倍低く、SLO満足度が6.7倍向上する。これは、変動的でピークが急激なワークロード下でも同様に成立する。

ABSTRACT

With deep neural networks (DNNs) emerging as the backbone in a multitude of computer vision tasks, their adoption in real-world applications broadens continuously. Given the abundance and omnipresence of smart devices in the consumer landscape, "smart ecosystems'' are being formed where sensing happens concurrently rather than standalone. This is shifting the on-device inference paradigm towards deploying centralised neural processing units (NPUs) at the edge, where multiple devices (e.g. in smart homes or autonomous vehicles) can stream their data for processing with dynamic rates. While this provides enhanced potential for input batching, naive solutions can lead to subpar performance and quality of experience, especially under spiking loads. At the same time, the deployment of dynamic DNNs, comprising stochastic computation graphs (e.g. early-exit (EE) models), introduces a new dimension of dynamic behaviour in such systems. In this work, we propose a novel early-exit-aware scheduling algorithm that allows sample preemption at run time, to account for the dynamicity introduced both by the arrival and early-exiting processes. At the same time, we introduce two novel dimensions to the design space of the NPU hardware architecture, namely Fluid Batching and Stackable Processing Elements, that enable run-time adaptability to different batch sizes and significantly improve the NPU utilisation even at small batches. Our evaluation shows that the proposed system achieves an average 1.97x and 6.7x improvement over state-of-the-art DNN streaming systems in terms of average latency and tail latency service-level objective (SLO) satisfaction, respectively.

研究の動機と目的

  • エッジベースのマルチデバイス推論ワークロードにおいて、厳格な遅延制約を満たしつつNPUの高利用度を維持する課題に対処すること。
  • DNNにおけるエアリー・エグジットによって生じる動的バッチサイズの変動が、深層層でハードウェア利用度を低下させるという性能劣化を克服すること。
  • 変動するリクエストレートとモデルのダイナミクスに対応した、効率的でランタイムで適応可能なバッチ処理とプリエンプションをサポートするシステムを設計すること。
  • Fluid Batchingとスタック可能なPEといった新規ハードウェアプリミティブとスケジューリングアルゴリズムを共同設計することで、ストリーミング推論におけるエッジNPUの効率を向上させること。

提案手法

  • 各レイヤーの即時のバッチサイズとレイヤー特性に基づき、動的にバッチ戦略を調整するハードウェアレベルのメカニズム「Fluid Batching」を導入。これにより、多様なバッチサイズにおいて高いパフォーマンスを実現する。
  • エグジットとデッドラインを考慮したプリエンプティブスケジューラを設計。これにより、中間エグジットで推論をランタイムでプリエンプト可能となり、エアリー・エグジットするサンプルを再バッチ化することでハードウェア利用度を維持できる。
  • 実行時再構成可能なスタック可能な処理素子(PEs)を提案。各レイヤーの入力テンソルサイズに合わせてPEの次元を動的に変更することで、小バッチサイズ時における利用度を向上させる。
  • スケジューラに正確な遅延推定を統合し、適切にアモアタイズドされたプリエンプションを実現。これによりオーバーヘッドとSLO違反を最小限に抑える。
  • ソフトウェアスケジューラとハードウェアプリミティブを共同設計することで、動的かつリアルタイムなエッジワークロードにおけるエンド・ツー・エンドの適応性と低遅延応答を確保する。
  • FPGAプラットフォーム(ZC706, ZCU104)上で、リカレントネットワーク-50とインセプション-v3のバックボーンにエアリー・エグジットを組み込んだフレームワークを、変動するリクエストレートとSLO制約の下で評価する。

実験結果

リサーチクエスチョン

  • RQ1DNNにおけるエアリー・エグジットによって生じる動的バッチサイズの変動に対応しつつ、遅延やハードウェア利用度を損なわずにバッチ処理を適応可能にする方法は何か?
  • RQ2リアルタイムで効率的なプリエンプションと再バッチ処理を可能にするために、どのようなハードウェアおよびスケジューリングメカニズムが必要か?
  • RQ3Fluid Batchingとスタック可能なPEは、さまざまなバッチサイズやワークロードにおいて、NPUの利用度と遅延パフォーマンスをどの程度向上できるか?
  • RQ4プリエンプティブでエグジット対応のスケジューラは、非プリエンプティブまたは静的バッチ処理手法と比較して、遅延が厳しいエッジ推論システムにおけるSLO違反をどれほど低減できるか?
  • RQ5提案手法は、畳み込み層とアテンションコンポーネントを併用するDNNアーキテクチャを含め、さまざまなDNNアーキテクチャにどの程度スケーラブルか?

主な発見

  • Fluid Batchingは、同じワークロード下で最先端のDNNストリーミングシステムと比較して、平均して1.97倍のスループット向上と6.7倍のSLO満足度向上を達成した。
  • SLOを妥当な閾値に設定した場合、すべてのテスト設定でSLO違反がゼロとなった。一方、ベースライン手法のAdaptBですら、緩いSLOでも顕著な違反を示した。
  • ZC706プラットフォームにおいて、バッチサイズが3を超えるとFluid Batchingはピーク性能に近づき、すべての静的バッチ戦略を上回った。
  • スタック可能なPEは小バッチサイズ(B=1を含む)において顕著なパフォーマンス向上をもたらした。Fluid Batchingとスタック可能なPEの併用により、あらゆるバッチサイズで優れた利用度が実現された。
  • エグジット対応プリエンプティブスケジューラにより、エアリー・エグジットするサンプルの効率的再バッチ処理が可能となり、動的バッチサイズの縮小が原因で生じる深層ネットワークサブネットのハードウェア未利用度が低減された。
  • 急激なリクエスト到着に対しても、高いパフォーマンスと低遅延を維持した。これは、実世界のエッジ展開シナリオにおける耐障害性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。