Skip to main content
QUICK REVIEW

[論文レビュー] Mobile Video Action Recognition

Yuqi Huo, Xiaoli Xu|arXiv (Cornell University)|Aug 27, 2019
Human Pose and Action Recognition参考文献 37被引用数 14
ひとこと要約

本論文は、モバイルデバイスで高速に処理可能な軽量なモバイル動画アクション認識フレームワークを提案する。このフレームワークは、MPEG-4などの圧縮動画から直接抽出されるIフレーム、動きベクトル、残差という3つのモダリティを、MobileNetV2と新規の時系列三重積プーリング(TTP)モジュールを用いて統合する。本手法はモバイルデバイスで約40 FPSの推論速度を達成し、モデル効率性において最先端のモデルを上回りながら、HMDB-51およびUCF101ベンチマークで競争力ある精度を維持する。

ABSTRACT

Video action recognition, which is topical in computer vision and video analysis, aims to allocate a short video clip to a pre-defined category such as brushing hair or climbing stairs. Recent works focus on action recognition with deep neural networks that achieve state-of-the-art results in need of high-performance platforms. Despite the fast development of mobile computing, video action recognition on mobile devices has not been fully discussed. In this paper, we focus on the novel mobile video action recognition task, where only the computational capabilities of mobile devices are accessible. Instead of raw videos with huge storage, we choose to extract multiple modalities (including I-frames, motion vectors, and residuals) directly from compressed videos. By employing MobileNetV2 as backbone, we propose a novel Temporal Trilinear Pooling (TTP) module to fuse the multiple modalities for mobile video action recognition. In addition to motion vectors, we also provide a temporal fusion method to explicitly induce the temporal context. The efficiency test on a mobile device indicates that our model can perform mobile video action recognition at about 40FPS. The comparative results on two benchmarks show that our model outperforms existing action recognition methods in model size and time consuming, but with competitive accuracy.

研究の動機と目的

  • 制限されたストレージと計算能力を有するモバイルデバイスにおける効率的な動画アクション認識のギャップを埋めること。
  • 生動画フレームやオプティカルフローの代わりに、圧縮動画表現を用いたアクション認識を可能にすること。
  • 複数の圧縮動画モダリティを効果的に統合できる、軽量でモバイル対応のフレームワークを設計すること。
  • キーフレーム統合を通じて時系列的文脈を明示的に組み込むことで、時系列モデリングを向上させること。
  • 高い推論速度(40 FPS)と小型なモデルサイズを実現しながら、競争力ある精度を維持すること。

提案手法

  • MPEG-4などの圧縮動画から直接、RGB Iフレーム、動きベクトル(MV)、残差(R)の3つのモダリティを抽出し、ストレージと計算量を削減する。
  • すべてのモダリティにおいて効率的な特徴抽出を実現するため、バックボーンネットワークとしてMobileNetV2を採用する。
  • Iフレーム、MV、Rの間でのクロスモダリティ相互作用を明示的にモデリングするため、時系列三重積プーリング(TTP)モジュールを提案する。
  • 連続するキーフレームを統合する時間的統合戦略を導入し、時系列表現学習を強化する。
  • 単純なスコア平均化やラテラル統合よりも優れた高次相互作用を捉えるために、三重積プーリングを採用する。
  • パラメータ数(17.5M)とGFLOPs(1.4)を最小限に抑えることで、モバイルデプロイメントに最適化し、約40 FPSの推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1生動画やオプティカルフローを用いずに、Iフレーム、動きベクトル、残差といった圧縮動画表現をモバイル動画アクション認識に効果的に利用できるか?
  • RQ2圧縮動画からのマルチモダリティ特徴をどのように統合すれば、効率性を保ちながら認識精度を向上させられるか?
  • RQ3軽量なフレームワークにおいて、時系列的文脈を明示的にモデリングすることで、モバイルデバイス上でのアクション認識を向上させられるか?
  • RQ4マルチモダリティ圧縮動画認識において、三重積プーリング機構が単純なアンサンブルやラテラル統合戦略を上回るか?
  • RQ540 FPS程度の高い推論速度をモバイルハードウェアで達成しながら、競争力ある精度を維持できるモデルは構築可能か?

主な発見

  • 提案されたTTPモデルは、モバイルデバイスで約40 FPSの推論速度を達成し、高いリアルタイム性能を示した。
  • 1750万パラメータと1.4 GFLOPsというわずかなリソースで、CoViAR(8360万パラメータ)やTwo-Stream(4660万パラメータ)といった最先端手法よりも顕著に効率的である。
  • HMDB-51ベンチマークでは、トップ1精度58.2%を達成し、モデル効率性においてCoViAR(59.1%)を上回り、ストレージを約80%削減した。
  • UCF101では、トップ1精度87.2%を達成し、CoViAR(90.4%)やTwo-Stream(88.0%)と同等の精度を維持しながら、顕著に低い計算コストを実現した。
  • TTPモジュールは、三重積プーリング(TP)やラテラル統合(I+MV+R)を上回り、より豊かなクロスモダリティ相互作用を捉えた。
  • 時間的統合手法は、基本的なTTPよりも1%の性能向上を達成し、明示的な時系列モデリングの重要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。