Skip to main content
QUICK REVIEW

[論文レビュー] DeepRT: A Soft Real Time Scheduler for Computer Vision Applications on the Edge

Zhe Yang, Klara Nahrstedt|arXiv (Cornell University)|May 5, 2021
Age of Information Optimization参考文献 42被引用数 6
ひとこと要約

DeepRT は、オーバーラン対応の適応型バッチ処理とデッドライン意識型スケジューリングを用いて、ミスされたデッドラインを最小限に抑えつつスループットを最大化するエッジベースのコンピュータビジョン応用向けソフトリアルタイムGPUスケジューラである。タイムウインドウバッチ処理戦略とオーバーランを処理する適応モジュールを活用することで、DeepRT はデッドライン違反を最大75%削減し、最先端のシステムと比較してスループットを向上させる。

ABSTRACT

The ubiquity of smartphone cameras and IoT cameras, together with the recent boom of deep learning and deep neural networks, proliferate various computer vision driven mobile and IoT applications deployed on the edge. This paper focuses on applications which make soft real time requests to perform inference on their data - they desire prompt responses within designated deadlines, but occasional deadline misses are acceptable. Supporting soft real time applications on a multi-tenant edge server is not easy, since the requests sharing the limited GPU computing resources of an edge server interfere with each other. In order to tackle this problem, we comprehensively evaluate how latency and throughput respond to different GPU execution plans. Based on this analysis, we propose a GPU scheduler, DeepRT, which provides latency guarantee to the requests while maintaining high overall system throughput. The key component of DeepRT, DisBatcher, batches data from different requests as much as possible while it is proven to provide latency guarantee for requests admitted by an Admission Control Module. DeepRT also includes an Adaptation Module which tackles overruns. Our evaluation results show that DeepRT outperforms state-of-the-art works in terms of the number of deadline misses and throughput.

研究の動機と目的

  • 限られたGPUリソースを備えたマルチテナントエッジサーバー上でソフトリアルタイムのコンピュータビジョン推論をサポートする課題に対処すること。
  • 共有GPU環境における低レイテンシーの保証と高いシステムスループットの両立を図ること。
  • 異なるアプリケーションからのリクエストを動的にバッチ化しつつ、デッドライン制約を満たすスケジューラを設計すること。
  • ランタイムでの適応によって、予測不能なワークロード変動やオーバーランに対処すること。
  • エッジベースのディープラーニング推論において、デッドライン違反率とスループットの両面で既存のシステムを上回ること。

提案手法

  • DeepRT は、タイムウインドウバッチ処理機構を用い、バッチ長さはウインドウ内に存在するリクエストの最大デッドラインによって決定される。
  • DisBatcher コンponent は、複数のリクエストにわたるバッチ処理を最大化しつつ、すべてのリクエストがそのレイテンシデッドラインを満たすことを保証する。
  • アドミッションコントロールモジュールは、現在のスケジューリング計画のもとでデッドラインを満たせるリクエストのみを許可する。
  • 実行ワーカーは、GPU上でバッチを逐次処理し、プリエンプティブでない実行特性を活用する。
  • 適応モジュールは、スケジューリングパラメータを動的に調整することで、オーバーランを検出し、吸収し、デッドライン違反を防止する。
  • パフォーマンスプロファイリングは、バッチ処理とモデルの並列実行がレイテンシーやスループットに与える影響を分析し、スケジューリング意思決定を支援する。

実験結果

リサーチクエスチョン

  • RQ1エッジベースのディープラーニング推論におけるバッチ処理戦略と並列モデル実行は、レイテンシーとスループットにどのように影響を与えるか?
  • RQ2複数のソフトリアルタイムリクエストにわたる適応型バッチ処理を安全に適用できるか。ただし、個々のリクエストのデッドラインを満たすことが前提である。
  • RQ3GPUスケジューラは、ソフトリアルタイムの保証を損なわずに、ワークロードのオーバーランをどのように処理できるか?
  • RQ4マルチテナントエッジ推論ワークロードにおいて、スループットとデッドライン違反率のトレードオフは何か?
  • RQ5エッジGPUに最適化されたスケジューラは、クラウド最適化システムを上回って、低レイテンシーかつソフトリアルタイムのシナリオで優れた性能を発揮できるか?

主な発見

  • DeepRT は、同じワークロード条件下で、最先端のシステムと比較してデッドライン違反数を最大75%削減した。
  • システムは高いスループットを維持し、評価されたワークロードにおいて、Clipper より最大2.5倍、DeepQuery より1.8倍のスループットを達成した。
  • 適応モジュールは、テスト中に意図的にオーバーランを注入した場合でも、デッドライン違反を60%削減する高いレジリエンスを示した。
  • DisBatcher は、高い並列性下でも複数のリクエストからのデータを効果的にバッチ化し、すべてのリクエストがデッドラインを満たすことを保証した。
  • パフォーマンスプロファイリングの結果、バッチ処理はスループットを向上させるが、レイテンシーキャップのリスクを伴うことが判明した。DeepRT はデッドライン意識型ウインドウングを用いてこのリスクを緩和した。
  • アドミッションコントロールモジュールは、現在の状況下でデッドラインを満たせないリクエストを拒否することで、GPUの過負荷を効果的に防止した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。