[論文レビュー] PREMA: A Predictive Multi-task Scheduling Algorithm For Preemptible Neural Processing Units
本稿では、軽量なチェックポイントによる低優先度タスクの知的なプリエンプションを用いて、待機時間、スループット、SLA準拠性を向上させる予測型マルチタスクスケジューリングアルゴリズムPREMAを提案する。プリエンプティブルなNPU向けに設計されており、非プリエンプティブなベースラインと比較して、平均正規化予測時間(ANTT)が最大7.8倍低減され、SLA満足度が1.4倍向上し、公平性が19.6倍向上する。ハードウェアオーバーヘッドは最小限に抑えられる。
To amortize cost, cloud vendors providing DNN acceleration as a service to end-users employ consolidation and virtualization to share the underlying resources among multiple DNN service requests. This paper makes a case for a "preemptible" neural processing unit (NPU) and a "predictive" multi-task scheduler to meet the latency demands of high-priority inference while maintaining high throughput. We evaluate both the mechanisms that enable NPUs to be preemptible and the policies that utilize them to meet scheduling objectives. We show that preemptive NPU multi-tasking can achieve an average 7.8x, 1.4x, and 4.8x improvement in latency, throughput, and SLA satisfaction, respectively.
研究の動機と目的
- クラウドベースのMLaaSにおける低遅延・高スループットなDNN推論の増大するニーズに対応し、プリエンプティブルなNPUを可能にする。
- DNNワークロードに特化した軽量なプリエンプションメカニズムを設計し、コンテキストスイッチングのオーバーヘッドを最小限に抑える。
- マルチタスクNPU環境における遅延、公平性、スループット、SLA準拠性のバランスを取る予測型スケジューリングポリシー(PREMA)を開発する。
- プリエンプションメカニズム(チェックポイント対比・キル)およびスケジューリングポリシーが、システム全体のパフォーマンス指標に与える影響を評価する。
提案手法
- コンテキスト状態サイズとプリエンプション遅延への影響を評価するために、チェックポイント、キル、ハイブリッドの3つのNPUプリエンプションメカニズムを設計する。
- スケジューリング意思決定のための軽量な回帰モデルを採用し、DNN推論時間を予測することで、予測に基づくタスク優先順位付けを可能にする。
- 予測実行時間に基づいて動的にタスクの順序を再編するプリエンプティブで高優先度優先のスケジューリングポリシーを導入する。
- 32nmプロセス技術において16同時実行タスクを想定し、オンチップSRAMに64ビット/タスクのコンテキスト追跡構造を実装し、面積はたったの0.01 mm²にとどまる。
- メモリオーバーインフレの対応として、DMAを介してCPUメモリにオーバーフローしたチェックポイント状態を移行するメモリ管理戦略を実装する。
- 実際のDNN(GoogLeNet、ResNetなど)を用い、バッチサイズやプリエンプションポイントを変化させた状況下で、合成ワークロードモデルを用いてパフォーマンスを評価する。
実験結果
リサーチクエスチョン
- RQ1NPU向けに、マルチタスクDNN推論における低オーバーヘッドタスクプリエンプションを実現する軽量なプリエンプションメカニズムを設計可能か?
- RQ2DNNワークロードにおいて、プリエンプションがチェックポイントコンテキスト状態のサイズと全体のプリエンプション遅延に与える影響はいかほどか?
- RQ3非プリエンプティブまたは優先度のみに基づくスケジューラーと比較して、予測型スケジューラーが遅延、スループット、SLA準拠性をどの程度改善できるか?
- RQ4ANTT、公平性、スループットの観点から、チェックポイントとキルのどちらがプリエンプションタスクに対して優れているか?
- RQ5さまざまなワークロード、バッチサイズ、プリエンプションポイントにおいて、PREMAスケジューラーの頑健性はどの程度か?
主な発見
- PREMAは、非プリエンプティブなFCFSスケジューリングと比較して、平均正規化予測時間(ANTT)を7.8倍改善した。
- アルゴリズムは、非プリエンプティブなベースラインスケジューラーと比較して、公平性を19.6倍向上し、スループットを1.4倍向上した。
- SLA違反率は4.8倍低減され、サービスレベル目標への準拠性が強く示された。
- チェックポイントはキルに比べ、ANTTで87%、STPで24%、公平性で77%優れており、最小限のパフォーマンスオーバーヘッドで実現された。
- 予測モデルは実際の推論時間と98%の相関を示し、オракルアクセスなしで正確なスケジューリング意思決定を可能にした。
- ハードウェア的およびエネルギー的オーバーヘッドは最小限で、32nmプロセス技術で16タスク分のコンテキスト追跡に0.01 mm²のSRAM領域を要し、スループットの向上に伴いエネルギー効率も比例して向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。