Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Action Recognition: A convolutional neural network model for temporally organized joint location data

Adhavan Jayabalan, Harish Karunakaran|arXiv (Cornell University)|Dec 20, 2016
Human Pose and Action Recognition参考文献 21被引用数 6
ひとこと要約

本論文では、時間的に整列した3次元関節位置データから人間の行動を認識する6層の畳み込みニューラルネットワーク(CNN)を提案し、コロンビアアクティビティデータセットで87%の精度を達成した。関節の軌道を順序付きの空間的・時間的特徴としてモデル化することで、ビデオや画像ベースの手法よりも次元が低く、効率的で高精度な行動認識が可能になった。

ABSTRACT

Motivation: Recognizing human actions in a video is a challenging task which has applications in various fields. Previous works in this area have either used images from a 2D or 3D camera. Few have used the idea that human actions can be easily identified by the movement of the joints in the 3D space and instead used a Recurrent Neural Network (RNN) for modeling. Convolutional neural networks (CNN) have the ability to recognise even the complex patterns in data which makes it suitable for detecting human actions. Thus, we modeled a CNN which can predict the human activity using the joint data. Furthermore, using the joint data representation has the benefit of lower dimensionality than image or video representations. This makes our model simpler and faster than the RNN models. In this study, we have developed a six layer convolutional network, which reduces each input feature vector of the form 15x1961x4 to an one dimensional binary vector which gives us the predicted activity. Results: Our model is able to recognise an activity correctly upto 87% accuracy. Joint data is taken from the Cornell Activity Datasets which have day to day activities like talking, relaxing, eating, cooking etc.

研究の動機と目的

  • 生動な動画や画像データに依存せずに、3次元関節位置の時系列データから人間の行動を認識する深層学習モデルの開発。
  • 関節の動きの時間的整列を活用して、行動認識の性能を向上させること。
  • 高次元の動画や画像入力ではなく、低次元の関節表現を用いることで、計算複雑性を低減すること。
  • 関節データを用いた行動認識において、CNNベースのアプローチとRNNベースのモデルの性能を比較すること。
  • コンパクトで構造化された関節データを用いることで、頑健で効率的な行動認識が可能であることを実証すること。

提案手法

  • 入力は15フレーム分の98個の関節の3次元座標を表す15×1961×4の関節特徴ベクトル系列を処理する。
  • 時間的に整列した関節データからスパatiotemporal特徴を抽出するために6層の畳み込みニューラルネットワークを適用する。
  • ネットワークは2次元畳み込みを用いて、関節間の空間的関係とフレーム間の時間的ダイナミクスを捉える。
  • グローバル平均プーリングにより特徴マップを1次元ベクトルに縮小し、分類のための最終全結合層に渡す。
  • 出力は予測された行動クラスを示すバイナリーベクトルであり、交差エントロピー損失を用いて学習される。
  • モデルは、日常的な活動の3次元関節位置を提供するコロンビアアクティビティデータセット上でエンドツーエンドに学習される。

実験結果

リサーチクエスチョン

  • RQ1時間的に整列した3次元関節位置データから、畳み込みニューラルネットワークが人間の行動を効果的に認識できるか?
  • RQ2関節データを用いた行動認識において、CNNベースのモデルとRNNベースのモデルの性能はどのように比較されるか?
  • RQ3ビデオや画像ベースの手法と比較して、低次元の関節データを用いることで、推論速度とモデルの単純さはどの程度向上するか?
  • RQ4深層CNNアーキテクチャを用いて、関節軌道データのみで達成可能な最大の認識精度は何か?
  • RQ52次元CNNを順序付き関節データに適用することで、関節の動きにおける空間的および時間的パターンを効果的に捉えることができるか?

主な発見

  • 提案されたCNNモデルは、3次元関節位置データのみを用いてコロンビアアクティビティデータセットで87%の認識精度を達成した。
  • 関節ベースの表現を用いることで、ビデオや画像入力と比較して顕著に次元が低く抑えられ、高い精度が達成された。
  • 関節データにCNNを適用することで、RNNのような再帰的モデルと比較して、推論が高速で、アーキテクチャが単純化された。
  • 2次元畳み込みを順序付きデータに適用することで、関節の空間的配置とフレーム間の時間的ダイナミクスを効果的に捉えることに成功した。
  • 適切な深層学習アーキテクチャを用いることで、関節データそのものが、頑健で効率的な行動認識に十分であることが示された。
  • 計算効率が向上する一方で、精度においても、あるいはそれ以上に、従来のRNNベースの手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。