Skip to main content
QUICK REVIEW

[論文レビュー] THIA: Accelerating Video Analytics using Early Inference and Fine-Grained Query Planning

Jiashen Cao, Ramyad Hadidi|arXiv (Cornell University)|Feb 16, 2021
Advanced Image and Video Retrieval Techniques参考文献 23被引用数 6
ひとこと要約

THIA は、動的スループット-精度トレードオフを実現する複数の早期終了ポイントを備えた単一のオブジェクト検出モデルに加え、細粒度のクエリ計画と軽量な終了ポイント推定器を組み合わせることで、動画分析を高速化する。最先端のシステムと比較して最大6.5倍の高速化を達成しながら、検出が難しいイベントにおいても高い精度を維持する。

ABSTRACT

To efficiently process visual data at scale, researchers have proposed two techniques for lowering the computational overhead associated with the underlying deep learning models. The first approach consists of leveraging a specialized, lightweight model to directly answer the query. The second approach focuses on filtering irrelevant frames using a lightweight model and processing the filtered frames using a heavyweight model. These techniques suffer from two limitations. With the first approach, the specialized model is unable to provide accurate results for hard-to-detect events. With the second approach, the system is unable to accelerate queries focusing on frequently occurring events as the filter is unable to eliminate a significant fraction of frames in the video. In this paper, we present THIA, a video analytics system for tackling these limitations. The design of THIA is centered around three techniques. First, instead of using a cascade of models, it uses a single object detection model with multiple exit points for short-circuiting the inference. This early inference technique allows it to support a range of throughput-accuracy tradeoffs. Second, it adopts a fine-grained approach to planning and processes different chunks of the video using different exit points to meet the user's requirements. Lastly, it uses a lightweight technique for directly estimating the exit point for a chunk to lower the optimization time. We empirically show that these techniques enable THIA to outperform two state-of-the-art video analytics systems by up to 6.5X, while providing accurate results even on queries focusing on hard-to-detect events.

研究の動機と目的

  • 特別に設計された軽量モデルまたは高負荷のモデルを用いたフレームフィルタリングに依存する既存の動画分析システムの限界を解消すること。
  • 動画内のイベント頻度や検出の難易度の変動に適応できない粗粒度のクエリ計画による非効率を克服すること。
  • 高いパフォーマンスと精度を維持しつつ、クエリ計画の最適化時間を短縮すること。
  • コンテンツの特徴に基づいて、動的にチャンク単位で推論の終了ポイントを選択可能にする仕組みを提供すること。

提案手法

  • THIA は、信頼度と複雑さに基づいて推論をショートサーキット化できる複数の早期終了ポイント(EPs)を備えた単一のディープラーニングモデルを用い、複数のスループット-精度トレードオフを実現する。
  • 細粒度のクエリ計画を採用し、動画の各チャンクに対して異なるEPを選択することで、各セグメントのパフォーマンスと精度を最適化する。
  • 各動画チャンクの最適なEPを推定するための軽量なディープラーニングモデルを用い、クエリ最適化に要する時間を顕著に短縮する。
  • EP間で共有パラメータを再利用することでモデル切り替えのオーバーヘッドを回避し、GPUメモリ使用量を最小限に抑える。
  • 早期終了ポイント推定器は、前方のモデルレイヤーからの特徴に基づいて最適なEPを予測するように訓練されており、高速でリアルタイムの計画意思決定を可能にする。
  • THIA は早期推論と適応的計画を統合することで、多様な動画ワークロードにわたって速度と精度のバランスを最適化する。

実験結果

リサーチクエスチョン

  • RQ1複数の終了ポイントを備えた単一モデルは、動画分析においてカスケードモデルよりも、速度とメモリ効率の点で優れていると言えるか?
  • RQ2動画チャンクごとに異なる終了ポイントを選択する細粒度のクエリ計画は、粗粒度の計画と比較して、パフォーマンス向上にどの程度効果的か?
  • RQ3サンプルフレームに対するフル推論を実行せずに、軽量な推定器が各動画チャンクの最適な終了ポイントを正確に予測できるか?
  • RQ4動的終了ポイント選択による早期推論は、従来の手法と比較して、検出が難しいイベントにおいてもどの程度精度を維持できるか?
  • RQ5適応的動画分析システムにおいて、最適化時間と計画品質のトレードオフはどの程度のものか?

主な発見

  • THIA は、検出が難しいイベントを含むクエリにおいても、2つの最先端の動画分析システムと比較して最大6.5倍の高速化を達成しながら、高い精度を維持する。
  • THIA の細粒度計画アプローチは、最適なブルートフォース計画と比較して実行時間がわずか0.3倍に抑えられ、高い計画品質を示している。
  • THIA のメモリフットプリントは5つの終了ポイントで2 GBであり、同じ数の終了ポイントを持つモデルカスケードの5 GBに比べて顕著に低い。
  • 終了ポイント推定モデルにより、サンプルフレームに対するフル推論を実行せずに、各チャンクごとの最良EPを即座に予測できるようになり、最適化時間が著しく短縮された。
  • THIA の早期推論技術により、カスケードモデルシステムに見られる高コストなモデル切り替えのオーバーヘッドが排除された。
  • 共有パラメータと切り替えコストの低減により、THIA はモデルカスケードアプローチよりも2倍の速度で性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。