Skip to main content
QUICK REVIEW

[論文レビュー] Compressed Video Action Recognition with Refined Motion Vector

Haoyuan Cao, Shining Yu|arXiv (Cornell University)|Oct 6, 2019
Human Pose and Action Recognition参考文献 27被引用数 8
ひとこと要約

本論文は、動画圧縮コーデックから得られるノイズの多い動きベクトルを改善することで、圧縮動画の行動認識を向上させる洗練された動きベクトル手法を提案する。光学フローの代替として、より効率的で正確な手法に置き換える。本手法は、最小限の計算オーバーヘッドでUCF-101およびHMDB-51で最先端の性能を達成し、3つのサブネットワークを使用する元のCoViARフレームワークよりも優れた性能を発揮する。

ABSTRACT

Although CNN has reached satisfactory performance in image-related tasks, using CNN to process videos is much more challenging due to the enormous size of raw video streams. In this work, we propose to use motion vectors and residuals from modern video compression techniques to effectively learn the representation of the raw frames and greatly remove the temporal redundancy, giving a faster video processing model. Compressed Video Action Recognition(CoViAR) has explored to directly use compressed video to train the deep neural network, where the motion vectors were utilized to present temporal information. However, motion vector is designed for minimizing video size where precise motion information is not obligatory. Compared with optical flow, motion vectors contain noisy and unreliable motion information. Inspired by the mechanism of video compression codecs, we propose an approach to refine the motion vectors where unreliable movement will be removed while temporal information is largely reserved. We prove that replacing the original motion vector with refined one and using the same network as CoViAR has achieved state-of-art performance on the UCF-101 and HMDB-51 with negligible efficiency degrades comparing with original CoViAR.

研究の動機と目的

  • 動画圧縮における動きベクトルの低品質、特にノイズが多く信頼性の低い問題に対処すること。
  • 時間的情報を保持しつつ、信頼性の低い動き成分を除去するように動きベクトルを洗練する手法を開発すること。
  • 圧縮動画データを用いて、光学フローの代替として軽量で効率的な代替手法を構築すること。
  • 顕著な速度低下を伴わずに、既存の圧縮動画行動認識手法を上回る精度を達成すること。

提案手法

  • 信頼度マップのしきい値処理を用いて、信頼性の低い動き成分を抑制することで、動きベクトルを洗練する。
  • ResNet-18に基づく洗練ネットワークを用いて動きベクトルを処理し、洗練された動き表現を生成する。
  • 洗練された動きベクトルを、光学フローに代わる二重ストリーム行動認識モデルの入力として使用する。
  • 生動画フレームを必要とせず、既存の圧縮動画データ(動きベクトルと残差)を活用する。
  • ノイズ除去と時間的整合性の維持を同時に実現するように設計されており、光学フローの挙動を模倣する。
  • CoViARと同一のネットワークアーキテクチャを用いて評価することで、公平な比較が可能となる。

実験結果

リサーチクエスチョン

  • RQ1圧縮動画からの洗練された動きベクトルは、生の動きベクトルよりも優れた行動認識性能を達成できるか?
  • RQ2圧縮動画データのみを用いた場合、動きベクトルの洗練は光学フローに基づく手法よりも高い精度をもたらすか?
  • RQ3洗練された動きベクトル手法は、精度向上を実現しつつも、高い推論速度を維持できるか?
  • RQ4三重ストリーム統合(動きベクトル+残差)を用いる手法よりも、洗練された動きベクトル手法は効率的か?
  • RQ5洗練された動きベクトルを用いた場合、より深いネットワークを用いることで性能がさらに向上するか?

主な発見

  • 洗練された動きベクトル手法は、HMDB-51(3つの分割の平均)でテスト精度59.69%を達成し、3ネットワーク統合を用いた元のCoViAR手法(59.1%)を上回った。
  • UCF-101では、CoViARと比較して顕著な効率の低下を伴わず、最先端の性能を達成した。
  • 2つのサブネットワーク(洗練されたmv + Iフレーム)のみを用いた本手法は、HMDB-51でCoViARの3サブネットワーク統合(mv + Iフレーム + 残差)を上回る精度を達成した。
  • 洗練された動きベクトルサブネットワークは、元のCoViARの残差サブネットワークよりも精度向上に寄与しており、より効果的な特徴表現であると示唆された。
  • 洗練された動きベクトルサブネットワークにResNet-34を用いた場合、HMDB-51 Split1で精度が1.5%向上した。これは、深さの増加に伴うスケーラビリティを示している。
  • 本手法はわずかな速度ペナルティしか発生せず、UCF-101では1秒間に486フレームを処理した。CoViARの500 fpsと比較して、低リソース環境でも実用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。