Skip to main content
QUICK REVIEW

[論文レビュー] Skeleton based Activity Recognition by Fusing Part-wise Spatio-temporal and Attention Driven Residues

Chhavi Dhiman, Dinesh Kumar Vishwakarma|arXiv (Cornell University)|Dec 2, 2019
Human Pose and Action Recognition参考文献 50被引用数 5
ひとこと要約

本稿では、部分別時空間特徴とアテンション駆動型残差を統合することで、アクション認識を向上させる、新しいスケルトンベースの3Dアクション認識フレームワーク、RIAFCNetを提案する。スケルトンを5つの身体部位に分割し、アテンション機構を備えたResNet-Inceptionハイブリッドアーキテクチャを活用することで、UT-Kinect、Florence 3D、MSR Daily Action3Dの各データセットで最先端のトップ-1精度を達成した。

ABSTRACT

There exist a wide range of intra class variations of the same actions and inter class similarity among the actions, at the same time, which makes the action recognition in videos very challenging. In this paper, we present a novel skeleton-based part-wise Spatiotemporal CNN RIAC Network-based 3D human action recognition framework to visualise the action dynamics in part wise manner and utilise each part for action recognition by applying weighted late fusion mechanism. Part wise skeleton based motion dynamics helps to highlight local features of the skeleton which is performed by partitioning the complete skeleton in five parts such as Head to Spine, Left Leg, Right Leg, Left Hand, Right Hand. The RIAFNet architecture is greatly inspired by the InceptionV4 architecture which unified the ResNet and Inception based Spatio-temporal feature representation concept and achieving the highest top-1 accuracy till date. To extract and learn salient features for action recognition, attention driven residues are used which enhance the performance of residual components for effective 3D skeleton-based Spatio-temporal action representation. The robustness of the proposed framework is evaluated by performing extensive experiments on three challenging datasets such as UT Kinect Action 3D, Florence 3D action Dataset, and MSR Daily Action3D datasets, which consistently demonstrate the superiority of our method

研究の動機と目的

  • スケルトン系列からの人間のアクション認識におけるクラス内変動とクラス間類似性の課題に対処すること。
  • スケルトンの部分別分解を通じて局所的運動ダイナミクスをモデル化することで、認識性能を向上させること。
  • 時空間CNNアーキテクチャにアテンション駆動型残差を統合することで、特徴表現を強化すること。
  • 運動の複雑さや視点の変化が異なる多様な3Dアクションデータセットに一般化可能な堅牢なフレームワークを開発すること。

提案手法

  • スケルトンを5つの解剖学的部位に分割し、局所的な時空間特徴学習を可能にする:頭部〜背骨、左脚、右脚、左手、右手。
  • InceptionV4をインspirationとするハイブリッドアーキテクチャ、RIAFCNetを設計し、残差ブロック(ResNet)とマルチブランチ畳み込み(Inception)を組み合わせて、効果的な3D時空間特徴抽出を実現する。
  • 時間経過に伴い顕著な運動パターンを動的に強調するアテンション駆動型残差を導入し、特徴の識別性を向上させる。
  • 重み付きラテナル融合機構を適用して部分別特徴を統合し、アクションクラス予測への寄与度に基づいてより情報量の多い身体部位を優先する。
  • 3D畳み込み層を用いて、スケルトン系列全体の関節座標における空間的・時間的依存関係を捉える。
  • 交差エントロピー損失と確率的勾配降下法を用いてネットワークを訓練し、ベンチマークデータセットにおけるトップ-1およびトップ-5精度を最適化する。

実験結果

リサーチクエスチョン

  • RQ1部分別時空間特徴学習は、スケルトンベースのアクション認識における認識精度を向上させるか?
  • RQ2アテンション駆動型残差の統合は、3Dスケルトンの特徴表現の識別性を向上させるのにどの程度有効か?
  • RQ3部分別特徴の重み付きラテナル統合は、グローバル特徴統合よりも優れた性能をもたらすか?
  • RQ4提案されたRIAFCNetアーキテクチャは、運動ダイナミクスが異なる多様な3Dアクションデータセットに一般化可能か?
  • RQ5各身体部位(例:手 vs. 腿)の最終的なアクション認識性能への寄与度は何か?

主な発見

  • 提案されたRIAFCNetは、UT-Kinect Action 3Dデータセットでこれまで報告された最高のトップ-1精度を達成し、先行する最先端手法を上回った。
  • Florence 3Dアクションデータセットでは、微細な運動差異を有するアクションを区別する際においても一貫した性能向上を示した。
  • MSR Daily Action3Dデータセットでも強力な結果を達成し、多様なアクションカテゴリーや運動パターンを有するデータセットにおいてもその堅牢性を確認した。
  • アブレーションスタディの結果、部分別特徴抽出とアテンション駆動型残差の両方が性能向上に顕著な寄与を果たしていることが確認された。
  • 重み付きラテナル統合機構は、識別に重要な部位(特に手や脚)を効果的に優先することができた。
  • アテンション機構は、微細なジェスチャーを伴うアクションや急速な四肢移動を伴うアクションにおいて、顕著な運動パターンを的確に強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。