Skip to main content
QUICK REVIEW

[論文レビュー] Skeletal Movement to Color Map: A Novel Representation for 3D Action Recognition with Inception Residual Networks

Huy Hieu Pham, Louahdi Khoudour|arXiv (Cornell University)|Jul 18, 2018
Human Pose and Action Recognition参考文献 23被引用数 6
ひとこと要約

本稿では、ポーズとモーション特徴を統合して3次元人間行動シーケンスをカラーマップとして符号化する新しい骨格表現手法SPMFを提案する。これにより、深層Inception-Residualネットワークを用いた効果的な3次元行動認識が可能となる。本手法は、先行手法よりも計算コストが低く、MSR Action3D(98.56%)およびNTU-RGB+D(クロスビュー評価時86.15%)で最先端の精度を達成した。

ABSTRACT

We propose a novel skeleton-based representation for 3D action recognition in videos using Deep Convolutional Neural Networks (D-CNNs). Two key issues have been addressed: First, how to construct a robust representation that easily captures the spatial-temporal evolutions of motions from skeleton sequences. Second, how to design D-CNNs capable of learning discriminative features from the new representation in a effective manner. To address these tasks, a skeletonbased representation, namely, SPMF (Skeleton Pose-Motion Feature) is proposed. The SPMFs are built from two of the most important properties of a human action: postures and their motions. Therefore, they are able to effectively represent complex actions. For learning and recognition tasks, we design and optimize new D-CNNs based on the idea of Inception Residual networks to predict actions from SPMFs. Our method is evaluated on two challenging datasets including MSR Action3D and NTU-RGB+D. Experimental results indicated that the proposed method surpasses state-of-the-art methods whilst requiring less computation.

研究の動機と目的

  • 3次元骨格シーケンスからの複雑な時空間的ダイナミクスを表現する課題に取り組む。
  • 新しい画像ベースの骨格表現から判別的特徴を効果的に学習できる深層学習フレームワークを設計する。
  • 従来の手法と比較して、計算複雑性を低減しつつ行動認識の精度を向上させる。
  • 初めて、非常に深いInception-ResNetアーキテクチャを骨格ベースの行動認識に適用可能かどうかを検証する。

提案手法

  • SPMFは、フレーム間の3次元骨格関節同士のユークリッド距離(JJD)を計算することで構築され、ポーズとモーション特徴を捉える。
  • ポーズ特徴(PFs)は静的関節距離から得られ、モーション特徴(MFs)はこれらの距離の連続フレーム間の時間的差分として計算される。
  • SPMF表現は、空間的配置が関節配置を符号化し、時間的変化が色の強度変動として符号化される2次元カラーマップに変換される。
  • SPMF画像から階層的特徴を抽出し、エンドツーエンドで行動を分類するためのカスタム深層学習フレームワークがInception-ResNetアーキテクチャに基づいて使用される。
  • ネットワークは残差接続とInceptionモジュールを採用し、深層アーキテクチャにおける勾配の流れと特徴学習を改善する。
  • 学習にはHe初期化、コサインスケジュールを用いたAdam最適化法を採用し、MSR Action3Dのような小規模データセットではデータオーグメンテーションも適用される。

実験結果

リサーチクエスチョン

  • RQ13次元骨格からの静的ポーズと動的モーション特徴を統合した統一表現が、複雑な人間行動を効果的に符号化できるか?
  • RQ2深層Inception-ResNetネットワークが、従来のRNNや手作業特徴と比較して、SPMFで符号化されたカラーマップから判別的特徴をより効果的に学習できるか?
  • RQ3提案手法のSPMF表現は、最先端の手法と比較して計算コストを低減しつつ認識精度を向上させられるか?
  • RQ4提案手法は、MSR Action3D や NTU-RGB+D のベンチマークデータセットにおけるクロスサブジェクトおよびクロスビュー評価プロトコルなど、さまざまな評価設定において汎用性を示せるか?

主な発見

  • SPMF Inception-ResNet-222モデルは、MSR Action3Dデータセットで平均98.56%の精度を達成し、すべての先行最先端手法を上回った。
  • NTU-RGB+Dデータセットでは、クロスビュー評価プロトコルで86.15%の精度に到達し、新たな最先端を記録した。
  • NTU-RGB+Dにおけるクロスサブジェクト評価でも78.89%の精度を達成し、前例の手法を大きく上回った。
  • 1つのGPU上で、1シーケンスあたりの学習時間は1.85×10⁻³秒、推論時間は0.128秒であり、リアルタイム処理の実現可能性が示された。
  • 中間特徴の可視化により、ネットワークがSPMF入力から空間的・時間的に整合性のある表現を学習していることが確認された。
  • アブレーションスタディの結果、ポーズ特徴とモーション特徴を両方組み合わせたSPMFが、片方の特徴のみを用いる場合よりも優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。