Skip to main content
QUICK REVIEW

[論文レビュー] Pose-Based Two-Stream Relational Networks for Action Recognition in Videos

Wei Wang, Jinjin Zhang|arXiv (Cornell University)|May 22, 2018
Human Pose and Action Recognition参考文献 32被引用数 7
ひとこと要約

本稿では、2次元人体ポーズのダイナミクスとアクション関連オブジェクトを統合的にモデル化するポーズベースの二ストリーム関係ネットワーク(PSRN)を提案する。ポーズシーケンスとオブジェクト特徴を、マルチロス監視付きのポーズ-オブジェクト関係ネットワークで統合することで、Sub-JHMDB(80.2%)およびPennAction(98.1%)で最先端の性能を達成し、人間-オブジェクト相互作用を明示的にモデル化することで、先行手法を上回った。

ABSTRACT

Recently, pose-based action recognition has gained more and more attention due to the better performance compared with traditional appearance-based methods. However, there still exist two problems to be further solved. First, existing pose-based methods generally recognize human actions with captured 3D human poses which are very difficult to obtain in real scenarios. Second, few pose-based methods model the action-related objects in recognizing human-object interaction actions in which objects play an important role. To solve the problems above, we propose a pose-based two-stream relational network (PSRN) for action recognition. In PSRN, one stream models the temporal dynamics of the targeted 2D human pose sequences which are directly extracted from raw videos, and the other stream models the action-related objects from a randomly sampled video frame. Most importantly, instead of fusing two-streams in the class score layer as before, we propose a pose-object relational network to model the relationship between human poses and action-related objects. We evaluate the proposed PSRN on two challenging benchmarks, i.e., Sub-JHMDB and PennAction. Experimental results show that our PSRN obtains the state-the-of-art performance on Sub-JHMDB (80.2%) and PennAction (98.1%). Our work opens a new door to action recognition by combining 2D human pose extracted from raw video and image appearance.

研究の動機と目的

  • 現実世界のシナリオにおいて入手が難しい3次元ポーズに依存するポーズベースのアクション認識手法の限界を解消すること。
  • 人間-オブジェクト相互作用認識に不可欠なアクション関連オブジェクトが、従来のポーズベース手法で軽視されている問題を克服すること。
  • 分類層でのラテン統合ではなく、人間ポーズと関連オブジェクトの間の関係をモデル化する整合的な統合戦略の開発。
  • 生動画からの2次元ポーズ推定と空間的外観特徴のみを用いて効果的なアクション認識を実現し、実用性と性能を向上させること。

提案手法

  • 改良されたOpenPoseモデルを用いて動画フレームから多人像2次元ポーズを抽出し、ターゲット人物のポーズを注釈機構で選択する。
  • 時間的運動パターンを捉えるために、ポーズ位置とポーズ速度の両方を別々の双方向LSTM-RNNでモデル化する。
  • 事前学習済みのVGG16ネットワークを用いて、ランダムに抽出された動画フレームから空間的オブジェクト特徴を抽出し、アクション関連オブジェクトを表現する。
  • 各オブジェクト特徴マップの列を候補オブジェクトとして扱い、ポーズ表現(LSTMからの出力)とオブジェクト特徴マップを統合するポーズ-オブジェクト関係ネットワークを構築する。
  • 各オブジェクト候補とポーズ隠れ状態 h^L_T および h^V_T を組み合わせることで関係特徴 R を計算し、ポーズ-オブジェクト相互作用の統合的モデリングを可能にする。
  • ポーズ位置LSTM、ポーズ速度LSTM、および最終関係特徴Rの3つの分類損失を用いてモデルを監視することで、より良い特徴表現を得るためのエンドツーエンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ12次元ポーズシーケンスと空間的オブジェクト特徴を組み合わせた二ストリームネットワークは、ポーズのみまたは外観のみのベースラインと比較して、アクション認識性能を向上させることができるか?
  • RQ2人間ポーズとアクション関連オブジェクトの関係的相互作用をモデル化することで、視覚的外観が類似するアクションにおいても一般化性能が向上し、誤分類が減少するか?
  • RQ3最終分類層より前で動作する関係的統合機構は、従来のラテン統合戦略に比べて、二ストリームネットワークで優れた性能を発揮するか?
  • RQ43次元ポーズではなく、生動画からの2次元ポーズ推定を用いることで、現実世界の環境における性能と実装可能性にどのような影響を与えるか?
  • RQ5提案されたマルチロス監視戦略は、ポーズダイナミクスおよびポーズ-オブジェクト関係の学習をどの程度向上させるか?

主な発見

  • PSRNはSub-JHMDBでトップ1正解率80.2%を達成し、RPAN(78.6%)を上回る最先端の性能を示した。
  • より困難なPennActionデータセットでは、PSRNが98.1%の正解率を達成し、RPAN(97.4%)を大きく上回り、誤分類数を31から20に削減した。
  • アブレーションスタディの結果、双方向LSTMと注釈機構の組み合わせがポーズ表現学習を向上させることを確認した。完全なPSRN(bi-LSTM + 注釈)はSub-JHMDBで83.7%、PennActionで98.1%を達成した。
  • ポーズ-オブジェクト関係ネットワークは不可欠である:関係モジュールを統合した二ストリーム統合が、他のすべてのストリーム統合バリアントを上回り、相互作用のモデリングにおける有効性を示した。
  • 誤分類マトリクスの分析から、PSRNは類似したアクション(例:tennis_forehand と tennis_serve、squat と bench_press)間の誤分類を低減しており、アクションダイナミクスおよびオブジェクト文脈のより良いモデリングを示している。
  • 特に明確なオブジェクトを伴うアクション(例:bench_press、squat、tennisアクション)において、モデルの性能向上が顕著に見られ、オブジェクトとの関係モデリングの重要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。