Skip to main content
QUICK REVIEW

[論文レビュー] Spatio-Temporal Gating-Adjacency GCN for Human Motion Prediction

Chongyang Zhong, Lei Hu|arXiv (Cornell University)|Mar 3, 2022
Human Pose and Action Recognition被引用数 10
ひとこと要約

本稿では、可学習な候補隣接行列の動的ブレンドを可能にするゲーティングネットワークを用いて、関節および時間的依存関係の適応的モデリングを可能にする、空間的・時間的ゲーティング隣接GCN(GAGCN)を提案する。この手法は、空間的・時間的特徴をバランスさせ統合することで、多様な行動タイプおよび長期予測精度において顕著に向上した汎化性能を達成し、Human 3.6M、AMASS、3DPWで最先端の性能を発揮する。

ABSTRACT

Predicting future motion based on historical motion sequence is a fundamental problem in computer vision, and it has wide applications in autonomous driving and robotics. Some recent works have shown that Graph Convolutional Networks(GCN) are instrumental in modeling the relationship between different joints. However, considering the variants and diverse action types in human motion data, the cross-dependency of the spatio-temporal relationships will be difficult to depict due to the decoupled modeling strategy, which may also exacerbate the problem of insufficient generalization. Therefore, we propose the Spatio-Temporal Gating-Adjacency GCN(GAGCN) to learn the complex spatio-temporal dependencies over diverse action types. Specifically, we adopt gating networks to enhance the generalization of GCN via the trainable adaptive adjacency matrix obtained by blending the candidate spatio-temporal adjacency matrices. Moreover, GAGCN addresses the cross-dependency of space and time by balancing the weights of spatio-temporal modeling and fusing the decoupled spatio-temporal features. Extensive experiments on Human 3.6M, AMASS, and 3DPW demonstrate that GAGCN achieves state-of-the-art performance in both short-term and long-term predictions.

研究の動機と目的

  • 複数の行動タイプにわたる人間の運動シーケンスにおける複雑で多様な空間的・時間的依存関係をモデル化する課題に対処すること。
  • 複数の行動タイプの運動予測に応用する際、固定された隣接行列のGCNにおける一般化性能の低さを克服すること。
  • 強化された特徴表現により、誤差の蓄積を軽減することで、長期的運動予測を改善すること。
  • バランスと統合されたモデリングにより、空間的関節関係と時間的運動傾向の間のクロス依存性を捉えること。
  • 未学習の行動タイプに対しても良好に一般化できるスケーラブルで適応的なGCNアーキテクチャを開発すること。

提案手法

  • モデルは、複数の候補空間的および時間的隣接行列のブレンド係数を学習するゲーティングネットワークを採用し、入力に依存する適応的隣接行列を実現する。
  • 空間的および時間的隣接行列は、別々の空間的および時間的ゲーティングネットワークから得た重みを用いてブレンドされる。
  • 空間的および時間的モデリングの寄与を調整するために、候補行列の数(例:S4, T3)を制御することで、両モodalのトレードオフを制御する。
  • 関節関係と時間的ダイナミクスの間のクロス依存性を捉えるために、空間的・時間的特徴はクロネッカー積を用いて統合される。
  • エンコーダはGAGCN層を用い、シーケンス・ツー・シーケンスの運動予測のために時間畳み込みネットワーク(TCN)デコーダを採用する。
  • アーキテクチャは、L2損失を用いてスケルトンベースの運動シーケンス上でエンド・ツー・エンドに訓練される。

実験結果

リサーチクエスチョン

  • RQ1ゲーティングネットワークは、運動予測における多様な人間の行動タイプに一般化可能な適応的隣接行列を効果的に学習できるか?
  • RQ2候補隣接行列の数をバランスさせることで、GCNベースの運動予測における空間的・時間的モデリングの性能にどのような影響を与えるか?
  • RQ3分離された空間的および時間的特徴を統合することで、人間の運動シーケンスにおけるクロス依存性のモデリングがどの程度向上するか?
  • RQ4本手法は、明示的な学習データが存在しない「Walking Together」のような未学習の行動タイプに対しても、良好に一般化するか?
  • RQ5既存のSOTA手法と比較して、本モデルの長期的運動予測性能はどの程度か?

主な発見

  • Human 3.6Mデータセットでは、GAGCNは80msで3D誤差10.1 mm、160msで16.9 mm、1000msで72.9 mmを達成し、先行手法を上回る性能を示した。
  • 長期予測(1000ms)において、GAGCNはHuman 3.6Mで72.9 mmの誤差を達成し、アブレーションスタディで次に優れた手法(93.9 mm)よりも顕著に低い誤差を記録した。
  • 未学習の行動タイプに対しても良好な一般化性能を示した:『Walking Together』(未学習)では13.1 mmの誤差を記録し、『Walking』(学習済み)の10.1 mmと比較して、強いゼロショット一般化性能を示した。
  • アブレーションスタディの結果、4つの空間的および3つの時間的候補行列(S4, T3)を用いることで最良の性能が得られ、80msでの誤差は10.1 mmに留まり、行列数が少ない設定を上回った。
  • 可視化の結果、周期的運動(例:『Walking』)に対しては非常に正確な予測が得られ、非周期的で複雑な運動(例:『Discussions』、『Posing』)に対しても妥当な結果が得られた。
  • 空間的ブレンド係数は行動タイプごとに有意に変化した:『Walking』と『Walking Together』はω3およびω4に対して類似した高い値を示したが、『Discussions』と『Sitting Down』は異なる分布を示し、適応的かつ行動固有の注視を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。