Skip to main content
QUICK REVIEW

[論文レビュー] AccMPEG: Optimizing Video Encoding for Video Analytics

Kuntai Du, Qizheng Zhang|arXiv (Cornell University)|Apr 26, 2022
Advanced Neural Network Applications被引用数 6
ひとこと要約

AccMPEG は、軽量モデルを用いてマクロブロック単位の精度勾配を学習することで、ビデオ分析向けに圧縮を最適化する動画エンコードシステムであり、カメラ側の計算負荷を低く抑えながら、ニアリアルタイムかつ高精度な DNN 推論を実現する。最新の最先端手法と比較して、エンドツーエンド遅延を 10–43% 減少させるとともに、最大 3% の精度向上を達成しながら、同程度のカメラ側のオーバーヘッドを維持する。

ABSTRACT

With more videos being recorded by edge sensors (cameras) and analyzed by computer-vision deep neural nets (DNNs), a new breed of video streaming systems has emerged, with the goal to compress and stream videos to remote servers in real time while preserving enough information to allow highly accurate inference by the server-side DNNs. An ideal design of the video streaming system should simultaneously meet three key requirements: (1) low latency of encoding and streaming, (2) high accuracy of server-side DNNs, and (3) low compute overheads on the camera. Unfortunately, despite many recent efforts, such video streaming system has hitherto been elusive, especially when serving advanced vision tasks such as object detection or semantic segmentation. This paper presents AccMPEG, a new video encoding and streaming system that meets all the three requirements. The key is to learn how much the encoding quality at each (16x16) macroblock can influence the server-side DNN accuracy, which we call accuracy gradient. Our insight is that these macroblock-level accuracy gradient can be inferred with sufficient precision by feeding the video frames through a cheap model. AccMPEG provides a suite of techniques that, given a new server-side DNN, can quickly create a cheap model to infer the accuracy gradient on any new frame in near realtime. Our extensive evaluation of AccMPEG on two types of edge devices (one Intel Xeon Silver 4100 CPU or NVIDIA Jetson Nano) and three vision tasks (six recent pre-trained DNNs) shows that AccMPEG (with the same camera-side compute resources) can reduce the end-to-end inference delay by 10-43% without hurting accuracy compared to the state-of-the-art baselines

研究の動機と目的

  • エッジ動画分析における、低遅延な動画エンコード、高精度なサーバー側 DNN 推論、低コストなカメラ側計算オーバーヘッドのバランスをとる課題に対処すること。
  • 特にオブジェクト検出やセマンティックセグメンテーションのような複雑なタスクにおいて、これら 3 つの要件を同時に満たせない既存の動画圧縮システムの限界を克服すること。
  • 特定のビデオ領域(マクロブロック)が最終的な DNN 精度に最も影響を与えることを同定することで、効率的でリアルタイムな動画ストリーミングを可能にすること。
  • 任意の新しい事前学習済み DNN に対して、パイプライン全体を再トレーニングすることなく迅速にカスタマイズ可能なシステムを設計すること。

提案手法

  • AccMPEG は、各 16×16 マクロブロックのエンコード品質が最終的な DNN 推論精度に与える影響を予測する軽量な精度勾配モデル(AccModel)を導入する。
  • AccModel は、小さな高速なニューラルネットワーク(例:MobileNet-SSD)であり、DNN 出力がマクロブロック単位の品質変化にどれほど感受性があるかを推定するようにトレーニングされる。
  • システムは H.264/265 コーデックを用いた領域別注目(RoI)エンコードを採用し、予測された精度勾配に基づいて各マクロブロックに異なる品質レベルを適用する。
  • AccModel は新しい DNN ごとに一度だけ再トレーニングまたはファインチューニングされるため、異なるビジョンモデルに迅速に適応可能で、最小限のオーバーヘッドで済む。
  • システムはフレームをバッチで処理し、k フレームごとに(例:k=10)AccModel を実行し、予測された勾配をもとにリアルタイムなエンコード意思決定をガイドする。
  • 精度勾配を予測することは完全なセマンティックセグメンテーションを予測するのよりも単純であるというインサイトを活用し、効率的なマクロブロック単位の品質制御を実現する。

実験結果

リサーチクエスチョン

  • RQ1軽量モデルは、動画分析におけるマクロブロック単位のエンコード品質が最終的な DNN 推論精度に与える影響を正確に予測できるか?
  • RQ2マクロブロックレベルでのエンコードを最適化することで、DNN 精度を向上させつつ、カメラ側の計算コストを最小限に抑える方法は何か?
  • RQ3最新の手法と比較して、エンドツーエンド遅延を低く抑えながら、DNN 推論精度を維持または向上させられるか?
  • RQ4パイプライン全体の再トレーニングを必要とせずに、新しい DNN アーキテクチャにどの程度効率的に適応できるか?

主な発見

  • AccMPEG は、最新の最先端手法と比較して、エンドツーエンド推論遅延を 10–43% 減少させつつ、DNN 精度を維持または向上させた。
  • 3 つのビジョンタスク(オブジェクト検出、セマンティックセグメンテーション、分類)を対象に、6 つの事前学習済み DNN を用いて平均で最大 3% の DNN 推論精度向上を達成した。
  • 従来のコーデックと同程度のカメラ側計算オーバーヘッドを維持しており、リソース制限のあるエッジデバイスにおいて実用的である。
  • 精度勾配モデル(AccModel)は、最小限の遅延で効果的なマクロブロック単位のエンコード意思決定を可能にする十分な精度を達成している。
  • 粗い粒度のアプローチ(例:オブジェクトレベルやフレームレベルの品質制御)よりも、細かく文脈に配慮した品質割り当てが可能であるため、性能が優れている。
  • Intel Xeon および NVIDIA Jetson Nano デバイスでの評価により、多様なエッジハードウェアプラットフォームで本システムの効率性と適応性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。