Skip to main content
QUICK REVIEW

[論文レビュー] Skeleton-Based Action Recognition Using Spatio-Temporal LSTM Network with Trust Gates

Jun Liu, Amir Shahroudy|arXiv (Cornell University)|Jun 26, 2017
Human Pose and Action Recognition参考文献 68被引用数 9
ひとこと要約

本稿では、骨格に基づく行動認識のための時空間LSTMネットワークと信頼ゲートを提案し、人間の関節の木構造的走査を用いて時系列的ダイナミクスと空間的依存関係をモデル化する。本手法は、ノイズに強い新しい信頼ゲートとLSTMユニット内でのマルチモーダル特徴融合を統合することで、7つのベンチマークデータセットで最先端の性能を達成する。

ABSTRACT

Skeleton-based human action recognition has attracted a lot of research attention during the past few years. Recent works attempted to utilize recurrent neural networks to model the temporal dependencies between the 3D positional configurations of human body joints for better analysis of human activities in the skeletal data. The proposed work extends this idea to spatial domain as well as temporal domain to better analyze the hidden sources of action-related information within the human skeleton sequences in both of these domains simultaneously. Based on the pictorial structure of Kinect's skeletal data, an effective tree-structure based traversal framework is also proposed. In order to deal with the noise in the skeletal data, a new gating mechanism within LSTM module is introduced, with which the network can learn the reliability of the sequential data and accordingly adjust the effect of the input data on the updating procedure of the long-term context representation stored in the unit's memory cell. Moreover, we introduce a novel multi-modal feature fusion strategy within the LSTM unit in this paper. The comprehensive experimental results on seven challenging benchmark datasets for human action recognition demonstrate the effectiveness of the proposed method.

研究の動機と目的

  • 人間関節系列における時系列的および空間的依存関係をモデル化することで、骨格に基づく行動認識を向上させること。
  • LSTMユニット内に学習可能な信頼ゲート機構を導入することで、3次元骨格データのノイズに対して耐性を高めること。
  • LSTMフレームワーク内でのマルチモーダル特徴融合により、特徴表現を強化すること。
  • 人間骨格の運動学的構造を木構造の走査戦略で活用し、より良い空間的文脈モデリングを実現すること。
  • 複数のベンチマークデータセットで、行動認識分野における最先端の性能を達成すること。

提案手法

  • 関節位置を時系列および骨格内の空間的隣接関係の両方で処理する時空間LSTM(ST-LSTM)ネットワークを提案する。
  • 運動学的関係に基づいた骨格の木構造的走査を用い、意味的に意味のある順序で関節を列挙する。
  • 各時刻における入力データの信頼性を学習する「信頼ゲート」メカニズムを導入し、メモリ更新を動的に調整する。
  • 各関節の幾何的および動的特徴を統合するため、LSTMユニット内にマルチモーダル特徴融合を組み込む。
  • 予測に基づく信頼ゲートを採用し、時系列的および空間的近傍からの文脈を用いて入力の信頼性を推定する(式30および式32)。
  • 時空間表現と行動分類の両方を統合的に最適化するため、ネットワーク全体をエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1骨格系列における空間的および時系列的依存関係をモデル化することで、行動認識の正確性が向上するか?
  • RQ2線形的または鎖状の走査と比較して、関節の木構造的走査は運動学的関係をどれほど効果的に捉えられるか?
  • RQ3学習可能な信頼ゲートは、行動認識におけるノイズの多い骨格データに対してどの程度耐性を高めるか?
  • RQ4LSTMユニット内でのマルチモーダル特徴融合は、判別的表現の強化にどの程度有効か?
  • RQ5提案された信頼ゲートを備えたST-LSTMは、多様なベンチマークデータセットで既存の最先端手法を上回るか?

主な発見

  • 提案された木構造走査を用いたST-LSTMは、7つのベンチマークデータセットすべてで最高の正確度を達成し、先行する最先端手法を上回った。
  • 信頼ゲート機構はST-LSTMおよび標準LSTMの両方の性能を向上させたが、より豊かな文脈情報が利用可能なST-LSTMでは、その向上効果が顕著に大きかった。
  • 木構造走査戦略は、関節鎖や二重関節鎖走査を上回り、意味的に意味のある関節順序の重要性を示した。
  • LSTMを時系列平均プーリングに置き換えると、性能が著しく低下し、RNNが順序的ダイナミクスをモデル化する優位性を確認した。
  • 信頼ゲートを備えたST-LSTMは最先端の結果を達成し、共同時空間モデリングとノイズ耐性の有効性を裏付けた。
  • 木構造走査における最後から最初へのリンクスキームが、認識正確度をさらに向上させた。これは、双方向的文脈伝播の利点を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。