Skip to main content
QUICK REVIEW

[論文レビュー] Low-Latency Human Action Recognition with Weighted Multi-Region Convolutional Neural Network

Yunfeng Wang, Wengang Zhou|arXiv (Cornell University)|May 8, 2018
Human Pose and Action Recognition参考文献 19被引用数 3
ひとこと要約

本論文は、フレーム蓄積を必要とせず、空間的・時間的文脈を捉えるために前景(主)および背景(副)領域からの重み付きマルチリージョン特徴抽出を用いる2次元ConvNetであるWMR ConvNetを提案する。この手法は、UCF101およびHMDB51で低遅延手法の中でも最先端の精度を達成し、3D ConvNetに基づくC3Dですら、動画クリップの集約やLSTMを必要としないにもかかわらずそれを上回る性能を発揮する。

ABSTRACT

Spatio-temporal contexts are crucial in understanding human actions in videos. Recent state-of-the-art Convolutional Neural Network (ConvNet) based action recognition systems frequently involve 3D spatio-temporal ConvNet filters, chunking videos into fixed length clips and Long Short Term Memory (LSTM) networks. Such architectures are designed to take advantage of both short term and long term temporal contexts, but also requires the accumulation of a predefined number of video frames (e.g., to construct video clips for 3D ConvNet filters, to generate enough inputs for LSTMs). For applications that require low-latency online predictions of fast-changing action scenes, a new action recognition system is proposed in this paper. Termed "Weighted Multi-Region Convolutional Neural Network" (WMR ConvNet), the proposed system is LSTM-free, and is based on 2D ConvNet that does not require the accumulation of video frames for 3D ConvNet filtering. Unlike early 2D ConvNets that are based purely on RGB frames and optical flow frames, the WMR ConvNet is designed to simultaneously capture multiple spatial and short term temporal cues (e.g., human poses, occurrences of objects in the background) with both the primary region (foreground) and secondary regions (mostly background). On both the UCF101 and HMDB51 datasets, the proposed WMR ConvNet achieves the state-of-the-art performance among competing low-latency algorithms. Furthermore, WMR ConvNet even outperforms the 3D ConvNet based C3D algorithm that requires video frame accumulation. In an ablation study with the optical flow ConvNet stream removed, the ablated WMR ConvNet nevertheless outperforms competing algorithms.

研究の動機と目的

  • 3D ConvNetやLSTM処理のためにフレーム蓄積を要する従来のアクション認識システムにおける高い遅延を解消すること。
  • 動画フレーム内の前景および背景リージョンからの空間的・時間的文脈を活用することで、低遅延オンラインアクション認識を向上させること。
  • LSTMを含まない軽量なアーキテクチャを構築し、リアルタイム推論を可能にしながら高い精度を維持すること。
  • マルチリージョン空間サンプリングと重み付き融合が、低遅延環境下で標準的な2ストリームまたは単一リージョン手法を上回ることを示すこと。

提案手法

  • 各動画フレームにおける主領域(前景)の検出と局所化に、微調整済みのFaster R-CNNを用いる。
  • 選択的探索(Selective Search)を用いて、主領域とのIOU値が異なる複数の副領域(背景)を抽出する。
  • RGBおよびオプティカルフロー入力を用いて、2次元ConvNetによるROIプーリングを適用し、主領域および副領域からの特徴を抽出する。
  • RGBストリームとオプティカルフロー ストリームの特徴を重み付き和演算により融合し、空間的および短期時間的特徴を統合する。
  • 空間ストリームではフレームを逐次処理し、時間ストリームでは10フレームのウィンドウで処理することで、30fpsで最大0.3秒の処理遅延を実現する。
  • ソフトマックス層からのスコアを用いたラテナル融合戦略を採用し、複数のリージョンからの予測を重み付き平均で統合する。

実験結果

リサーチクエスチョン

  • RQ1フレーム蓄積や3次元空間的時間的畳み込みを必要としない2次元ConvNetベースのシステムが、高いアクション認識精度を達成できるか?
  • RQ2特に背景領域を含む複数の空間的リージョンを統合することで、低遅延環境下での認識性能が向上するか?
  • RQ3主領域および副領域からの特徴の重み付き融合は、SVMベースの統合や特徴連結と比較してどれほど効果的か?
  • RQ4オプティカルフローまたはLSTMコンponentを含まないシステムでも、これらのコンponentに依存する最先端のモデルを上回ることができるか?

主な発見

  • WMR ConvNetはUCF101で85.7%、HMDB51で66.7%の精度を達成し、すべての競合する低遅延2D ConvNet手法を上回り、UCF101ではiDTやC3Dと同等またはそれを上回る。
  • オプティカルフロー ストリームを除去したアブレーション版のWMR ConvNetでも、UCF101で78.8%の精度を達成し、動的画像ネットワークや他のRGBオンリーメソッドを上回る。
  • スコアレベル特徴の重み付き和融合は、SVMベースの統合や特徴レベル連結よりも優れており、UCF101スプリット-1で75.9%の精度を達成した。
  • RGBフレームからのバウンディングボックスを主領域として使用すると、オプティカルフローの大きさに基づく領域選択よりも優れた結果が得られ、RGBの特徴がより情報量が多いことを示している。
  • 最大処理遅延はたったの0.3秒であり、数秒から数10秒の遅延を生じるクリップベースの3D ConvNetやLSTMシステムと比べて顕著に低い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。