Skip to main content
QUICK REVIEW

[論文レビュー] Body Joint guided 3D Deep Convolutional Descriptors for Action Recognition

Congqi Cao, Yifan Zhang|arXiv (Cornell University)|Apr 24, 2017
Human Pose and Action Recognition参考文献 34被引用数 6
ひとこと要約

本稿では、人体の関節位置を用いて3次元畳み込み特徴マップからの活性化を選択的にプーリングする、ボディジョイントガイドド3次元ディープコンvolutionラルディスクリプタ(JDD)を提案する。これにより、判別性の高い動画レベルの記述子が形成される。さらに、関節ガイドドプーリングと空間時間的特徴を同時に学習するエンドツーエンドの2ストリームバイリニアC3Dモデルを導入し、正確なスケルトンアノテーションに依存せずにUCF101およびKineticsデータセットで最先端の精度を達成した。

ABSTRACT

Three dimensional convolutional neural networks (3D CNNs) have been established as a powerful tool to simultaneously learn features from both spatial and temporal dimensions, which is suitable to be applied to video-based action recognition. In this work, we propose not to directly use the activations of fully-connected layers of a 3D CNN as the video feature, but to use selective convolutional layer activations to form a discriminative descriptor for video. It pools the feature on the convolutional layers under the guidance of body joint positions. Two schemes of mapping body joints into convolutional feature maps for pooling are discussed. The body joint positions can be obtained from any off-the-shelf skeleton estimation algorithm. The helpfulness of the body joint guided feature pooling with inaccurate skeleton estimation is systematically evaluated. To make it end-to-end and do not rely on any sophisticated body joint detection algorithm, we further propose a two-stream bilinear model which can learn the guidance from the body joints and capture the spatio-temporal features simultaneously. In this model, the body joint guided feature pooling is conveniently formulated as a bilinear product operation. Experimental results on three real-world datasets demonstrate the effectiveness of body joint guided pooling which achieves promising performance.

研究の動機と目的

  • 完全結合層特徴に依存するのではなく、人体関節位置を活用して3次元CNNにおける特徴プーリングをガイドすることで、動画行動認識の性能を向上させること。
  • 手作業で作成されたスケルトン特徴の限界を解消し、『つかむ』と『置く』のような類似行動を区別しにくい点を改善すること。
  • 外部のスケルトン推定に依存しない、関節検出と特徴プーリングを統合したエンドツーエンドで訓練可能なモデルを開発すること。
  • 不正確なスケルトン推定下でも、関節ガイドドプーリングのロバスト性を評価し、実世界のシナリオにおける実用性を検証すること。
  • RGB動画入力のみを用いて、標準的な行動認識ベンチマークで最先端の性能を達成すること。

提案手法

  • 本手法は、人体関節位置に対応する空間的位置に3次元畳み込み特徴マップの活性化をプールし、関節プールド記述子(JDD)を形成する。
  • 特徴マップへの関節位置のマッピングのための2つの手法を提案:最近傍サンプリングと双一次補間。
  • 2ストリームバイリニアC3Dモデルは、注意ストリームでReLUの代わりにシグモイド関数を用い、関節ガイドドプール重みを予測することでエンドツーエンド学習を可能にする。
  • プーリング操作は、関節位置と特徴マップのバイリニア積として定式化され、微分可能な特徴集約が可能になる。
  • モデルは、空間時間的特徴抽出のための特徴ストリーム(C3D)と、関節ガイドドプールのための注意ストリームを備え、両方を同時に学習する。
  • 異なる畳み込み層(例:conv4bとconv5b)からのJDDのマルチレイヤーフュージョンを用いて、判別力の強化を図る。

実験結果

リサーチクエスチョン

  • RQ1標準的な完全結合層特徴と比較して、3次元CNN特徴のボディジョイントガイドドプーリングは、行動認識性能を向上させることができるか?
  • RQ2本手法はスケルトン推定の誤差に対してどれほどロバストであり、依然として既存手法を上回る性能を示すか?
  • RQ3事前に計算された関節位置に依存せずに、関節ガイドドプール操作をエンドツーエンドで訓練可能な深層学習フレームワークに統合できるか?
  • RQ4複数の畳み込み層からのJDDの統合により、認識精度がさらに向上するか?
  • RQ52ストリームバイリニアC3Dモデルは、RGB入力のみを用いて標準ベンチマークで最先端の性能を達成できるか?

主な発見

  • エンドツーエンドの2ストリームバイリニアC3Dモデルは、微調整なしでUCF101で84.7%の精度を達成し、すべての競合するRGBベースのモデルを上回った。
  • 正解のボディジョイントを用いた場合、conv4bとconv5bからのJDDのマルチレイヤーフュージョンは、Kineticsで98.1%の精度を達成し、本論文で報告された最高の結果となった。
  • 不正確なスケルトン推定下でも、ボディジョイントガイドドプール手法は強力な性能を維持し、ロバスト性を示した。
  • 高度な集約手法を用いた場合、2ストリームバイリニアC3DモデルはKineticsで95.3%の精度を達成し、バイリニア定式化の有効性を示した。
  • 本手法はC3Dのfc6特徴や、光流体や密なトラジェクトリを用いた他の最先端モデルをも凌駕した。
  • アブレーションスタディにより、関節ガイドドプールがグローバル平均プールやfc6特徴よりもより判別性の高い空間時間的パターンを捉えていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。