Skip to main content
QUICK REVIEW

[論文レビュー] Fully-Coupled Two-Stream Spatiotemporal Networks for Extremely Low Resolution Action Recognition

Mingze Xu, Aidean Sharghi|arXiv (Cornell University)|Jan 11, 2018
Human Pose and Action Recognition参考文献 29被引用数 7
ひとこと要約

本論文は、極めて低解像度の動画(12×16ピクセル)における行動認識のための完全結合型2ストリーム空間時間畳み込みニューラルネットワークアーキテクチャを提案する。本手法は、スタックドオプティカルフロー、3次元畳み込み(C3D)、およびGRUネットワークを用いて、局所的および長距離の時間的ダイナミクスをモデル化する。この手法は、事前学習を省略しても、先行研究と比較してHMDB51で7.2%、DogCentricで3.7%の精度向上を達成し、最先端の性能を発揮する。

ABSTRACT

A major emerging challenge is how to protect people's privacy as cameras and computer vision are increasingly integrated into our daily lives, including in smart devices inside homes. A potential solution is to capture and record just the minimum amount of information needed to perform a task of interest. In this paper, we propose a fully-coupled two-stream spatiotemporal architecture for reliable human action recognition on extremely low resolution (e.g., 12x16 pixel) videos. We provide an efficient method to extract spatial and temporal features and to aggregate them into a robust feature representation for an entire action video sequence. We also consider how to incorporate high resolution videos during training in order to build better low resolution action recognition models. We evaluate on two publicly-available datasets, showing significant improvements over the state-of-the-art.

研究の動機と目的

  • データの忠実度を最小限に抑えることで、動画監視におけるプライバシー懸念に対処すること。
  • 空間的詳細が著しく損なわれる極めて低解像度の動画(例:12×16ピクセル)においても、人の行動を認識する課題を克服すること。
  • 低解像度の動画シーケンスにおいて、空間的外観と時間的動きの両方の手がかりを効果的に捉える深層学習フレームワークを開発すること。
  • 高解像度の動画を訓練中に活用することで、ドメイン間の特徴変換を学習し、モデルの汎化能力を向上させること。
  • 低品位な動画における行動認識を向上させるために、マルチレベルの時間的モデリングを統合した堅牢でエンドツーエンドのアーキテクチャを設計すること。

提案手法

  • RGBフレームとスタックド密なオプティカルフロー場のための別々のブランチを持つ2ストリームネットワークを採用し、空間的特徴と動きの特徴を独立して捉える。
  • 短い動画クリップ(局所的時間的モデリング)からコンパクトな空間時間的特徴を抽出するために、3次元畳み込みニューラルネットワーク(C3D)を用いる。
  • C3D特徴を全動画シーケンスにわたって処理することで、長距離の時間的依存関係をモデル化するため、ゲート付き再帰ユニット(GRU)ネットワークを統合する。
  • 高解像度および低解像度の特徴学習パス間でパラメータを共有する完全結合型アーキテクチャを実装し、訓練中に高解像度データからの知識移行を可能にする。
  • 特徴を2ストリームブランチから組み合わせるために、連結、マックスプーリング、畳み込み統合よりも優れた性能を達成するため、和集合融合を適用する。
  • 特にデータ量が少ない状況でも特徴学習の効率と性能を向上させるために、Sport-1Mデータセット上で事前学習されたC3Dモデルを活用する。

実験結果

リサーチクエスチョン

  • RQ1空間的特徴と動きの特徴を組み合わせることで、完全結合型2ストリーム空間時間ネットワークは、極めて低解像度の動画(12×16ピクセル)においても行動認識を効果的に行えるか?
  • RQ2訓練中に高解像度の動画を組み込むことで、低解像度の行動認識モデルの性能はどのように向上するか?
  • RQ33次元畳み込みによる局所的空間時間的特徴と、RNNによる長距離時間的モデリングの、低解像度の行動認識における相対的寄与度は何か?
  • RQ4異なる統合戦略(和集合、マックスプーリング、連結、畳み込み)は、2ストリームフレームワークにおける最終的な認識精度にどのように影響するか?
  • RQ5低解像度の行動認識タスクに微調整する際、高解像度データセットでの事前学習は、性能向上にどの程度寄与するか?

主な発見

  • 提案手法は、事前学習されたC3Dを用いてHMDB51データセットで44.96%の精度を達成し、以前の最先端手法(Multi-Siamese Embedding CNNの37.70%)と比較して7.2%の向上を示した。
  • 事前学習を省略しても、HMDB51で41.04%の精度を達成し、以前の最先端手法を3.3%上回った。これは、強力な汎化能力を示している。
  • DogCentricデータセットでは73.19%の精度を達成し、以前の最先端手法(Multi-Siamese Embedding CNNの69.43%)と比較して3.7%の向上を示した。
  • GRU部は、2つの全結合層に置き換えた場合と比較して約4.5%の精度向上を示し、長距離時間的モデリングの重要性を強調している。
  • 2ストリームアーキテクチャは、空間的特徴のみを用いる1ストリームモデルと比較して4.2%の性能向上を達成し、時間的特徴を用いるモデルと比較して19.2%の向上を示した。これは、動き符号化の価値を確認している。
  • ストリーム特徴の和集合融合が、全評価設定においてマックス統合、連結、畳み込み統合よりも優れた性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。