[論文レビュー] ApproxNet: Content and Contention Aware Video Analytics System for the Edge.
ApproxNet は、コンテンツの複雑さ、システムリソースの変動、ユーザー要件に応じて、遅延と精度のバランスを動的に調整できる、エッジデバイス向けの動的ビデオ分析システムである。1つのDNNモデル内で2つのランタイム近似スイッチを用いることで、MCDNNのようなアンサンブルモデルのメモリとスイッチングのオーバーヘッドを回避し、低く安定した推論遅延を達成する。
Videos take lot of time to transport over the network, hence running analytics on live video at the edge devices, right where it was captured has become an important system driver. However these edge devices, e.g., IoT devices, surveillance cameras, AR/VR gadgets are resource constrained. This makes it impossible to run state-of-the-art heavy Deep Neural Networks (DNNs) on them and yet provide low and stable latency under various circumstances, such as, changes in the resource availability on the device, the content characteristics, or requirements from the user. In this paper we introduce ApproxNet, a video analytics system for the edge. It enables novel dynamic approximation techniques to achieve desired inference latency and accuracy trade-off under different system conditions and resource contentions, variations in the complexity of the video contents and user requirements. It achieves this by enabling two approximation knobs within a single DNN model, rather than creating and maintaining an ensemble of models (such as in MCDNN [Mobisys-16]). Ensemble models run into memory issues on the lightweight devices and incur large switching penalties among the models in response to runtime changes. We show that ApproxNet can adapt seamlessly at runtime to video content changes and changes in system dynamics to provide low and stable latency for object detection on a video stream. We compare the accuracy and the latency to ResNet [2015], MCDNN, and MobileNets [Google-2017].
研究の動機と目的
- IoTセンサーや監視カメラのようなリソース制限のあるエッジデバイスで、重いDNNを実行する課題に対処すること。
- 動的なビデオコンテンツの変化やシステムリソースの可用性の変動にもかかわらず、安定した低遅延でリアルタイムのビデオ分析を実現すること。
- MCDNNなどの複数のDNNモデルを維持する際のメモリとスイッチングのオーバーヘッドを排除するため、1つのモデル内に2つの近似スイッチを導入すること。
- コンテンツとシステム状態に応じて、推論精度と計算量を動的に調整できるランタイム適応型システムを提供すること。
- ユーザー要件や環境の変動に応じた、推論精度と遅延のバランスのとれた最適なトレードオフを達成すること。
提案手法
- 1つのDNNモデル内に動的レイヤープルーニングと適応的量子化の2つの近似スイッチを導入し、モデルの複雑さをランタイムで調整可能にする。
- ビデオの複雑さの変化を検出するコンテンツに適したヒューリスティクスを用い、適切な近似レベルをトリガーする。
- CPUやメモリなどのシステムリソースの可用性を監視し、ターゲット遅延を維持するために近似パラメータを調整する。
- 動的ワークロード下でも所望の精度-遅延トレードオフを維持するためのフィードバック制御メカニズムを採用する。
- 複数の推論設定をサポートするが、モデルスイッチングを伴わない統合アーキテクチャを設計する。
- 近似制御を最小限の変更で統合できる、既存のDNNフレームワークを活用する。
実験結果
リサーチクエスチョン
- RQ11つのDNNモデルが、変動するビデオコンテンツとシステム状態に応じて、どのようにして低く安定した遅延を維持する推論動作を動的に適応できるか?
- RQ2アンサンブルモデルを置き換えるために、1つのモデルに統合可能な最も効果的な近似スイッチは何か?
- RQ3ランタイム近似を備えた統合モデルは、MCDNNのようなマルチモデルアンサンブルと比較して、メモリ効率と遅延安定性の面で優れているか?
- RQ4コンテンツの複雑さやリソース制約に応じて、計算負荷を低減しながらも、精度をどのように維持できるか?
- RQ5動的近似が、リアルタイムビデオ分析におけるエンドツーエンドの推論遅延と精度に及ぼす影響は何か?
主な発見
- ApproxNet は、変動するビデオコンテンツやシステム負荷の下でも、MCDNN や MobileNets と比較して顕著に低く安定した推論遅延を達成する。
- アンサンブルベースのアプローチとは異なり、複数のDNNモデルを保存・切り替える必要がないため、メモリオーバーヘッドを削減する。
- 固定モデル選択ではなく、適応的近似により、同じ遅延制約下でもMCDNNよりも高い平均精度を維持する。
- 動的近似メカニズムにより、コンテンツの変化やシステムのフラクチュエーションにすばやく適応でき、顕著な性能劣化なしに動作を継続できる。
- 複数のモデルを1つの構成可能な推論パスに統合することで、モデルスイッチングのペナルティを低減し、ランタイム効率を向上させる。
- 評価結果から、ApproxNet はエッジデバイス上での遅延と精度のバランスにおいて、ResNet や MCDNN、MobileNets を上回っている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。