Skip to main content
QUICK REVIEW

[論文レビュー] Symbiotic Graph Neural Networks for 3D Skeleton-based Human Action Recognition and Motion Prediction

Maosen Li, Siheng Chen|arXiv (Cornell University)|Oct 5, 2019
Human Pose and Action Recognition被引用数 13
ひとこと要約

本稿では、マルチスケールグラフ畳み込みニューラルネットワークを用いた、3次元スケルトンベースの行動認識と運動予測のための連合モデルであるSymbiotic Graph Neural Networks (Sym-GNN)を提案する。ジョイントスケールおよびパーツスケールのグラフを二重ボーンベースネットワークと統合することで、認識ヘッドと予測ヘッドの間で相互監視を実現し、特徴抽出を強化した。NTU-RGB+D、Kinetics、Human3.6M、CMU Mocapの4つのデータセットにおいて、最先端の性能を達成した。

ABSTRACT

3D skeleton-based action recognition and motion prediction are two essential problems of human activity understanding. In many previous works: 1) they studied two tasks separately, neglecting internal correlations; 2) they did not capture sufficient relations inside the body. To address these issues, we propose a symbiotic model to handle two tasks jointly; and we propose two scales of graphs to explicitly capture relations among body-joints and body-parts. Together, we propose symbiotic graph neural networks, which contain a backbone, an action-recognition head, and a motion-prediction head. Two heads are trained jointly and enhance each other. For the backbone, we propose multi-branch multi-scale graph convolution networks to extract spatial and temporal features. The multi-scale graph convolution networks are based on joint-scale and part-scale graphs. The joint-scale graphs contain actional graphs, capturing action-based relations, and structural graphs, capturing physical constraints. The part-scale graphs integrate body-joints to form specific parts, representing high-level relations. Moreover, dual bone-based graphs and networks are proposed to learn complementary features. We conduct extensive experiments for skeleton-based action recognition and motion prediction with four datasets, NTU-RGB+D, Kinetics, Human3.6M, and CMU Mocap. Experiments show that our symbiotic graph neural networks achieve better performances on both tasks compared to the state-of-the-art methods.

研究の動機と目的

  • 3次元スケルトンベースの行動認識と運動予測を独立したタスクとして扱う際の限界を是正し、それらの相互依存関係を無視しないこと。
  • 3次元スケルトンにおける局所的ジョイント関係と高レベルのボディパーツ間相互作用を明示的にモデル化することで、特徴表現を向上させること。
  • 共有バックボーン特徴を用いた認識ヘッドと予測ヘッドの共同学習により、モデルのロバスト性と性能を向上させること。
  • アクション固有のダイナミクスと物理的制約を同時に捉えることができるマルチスケールグラフ畳み込みフレームワークを開発すること。
  • 共有で補完的な表現を用いて、早期かつ正確な行動分類と、高精度な長期的運動予測を実現すること。

提案手法

  • モデルは、ジョイントスケールおよびパーツスケールの両方のグラフを処理するマルチブランチ・マルチスケールグラフ畳み込みバックボーンを採用し、空間的・時間的特徴を抽出する。
  • ジョイントスケールのグラフには、アクションベースのダイナミクスを捉える「アクショナルグラフ」と、ジョイント間の物理的制約をモデル化する「構造的グラフ」が含まれる。
  • パーツスケールのグラフは、ジョイントを体の部位(例:四肢)にグループ化することで、高レベルの意味的関係を表現し、一般化性能を向上させる。
  • 二重ボーンベースネットワークは、ジョイント座標から導出されるボーンベクトルから補完的特徴を学習し、運動パターンのモデル化を強化する。
  • 行動認識ヘッドと運動予測ヘッドは共同で学習され、予測された行動カテゴリが運動ヘッドにフィードバックされ、将来のポーズ生成をガイドする。
  • グラフ推論モジュールは、入力の摂動に対して安定であることが実証され、理論的境界ではノイズに対して線形応答(q ≈ 1)を示し、ロバスト性を保証する。

実験結果

リサーチクエスチョン

  • RQ1行動認識と運動予測の共同学習は、独立したモデルと比較して、両タスクの性能向上をもたらすか?
  • RQ2ジョイントスケールとパーツスケールのマルチスケールグラフは、3次元スケルトンモデリングにおける特徴表現をどのように向上させるか?
  • RQ3認識ヘッドと予測ヘッドの間の共生的相互作用は、特徴学習と一般化性能をどの程度向上させるか?
  • RQ4モデルは入力ノイズ下でも性能を維持するか?また、グラフベースの推論は安定か?
  • RQ5提案されたグラフ構造は、人間の運動における局所的ダイナミクスと長距離のアクション関連関係を効果的に捉えられるか?

主な発見

  • Sym-GNNは、NTU-RGB+D(クロスサブジェクトスプリット)において、先行研究を上回る最先端の行動認識精度を達成した。
  • Human3.6Mでは、前回SOTA手法と比較して、運動予測の平均絶対誤差(MAE)を最大12.3%まで低減した。
  • 入力スケルトンにガウスノイズ(σ ≤ 0.04)が加えられても、認識精度が90%以上を維持した。
  • 運動予測の結果から、Sym-GNNはRes-sup、AGED、CSMと比較して、より現実的で高精度な長期シーケンスを生成しており、過剰回転やねじれアーチファクトを回避した。
  • 摂動解析により、グラフ畳み込みモジュールが安定しており、応答のずれが入力ノイズに線形に比例(増幅係数 q ≈ 1)することが確認された。
  • ジョイントスケールのアクショナルグラフの可視化から、意味的に類似した行動(例:歩行、一緒に歩く)が埋め込み空間で密にクラスタリングされていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。