Skip to main content
QUICK REVIEW

[論文レビュー] DMS-GCN: Dynamic Mutiscale Spatiotemporal Graph Convolutional Networks for Human Motion Prediction

Zigeng Yan, Di‐Hua Zhai|arXiv (Cornell University)|Dec 20, 2021
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、10フレームの観測から人間の動きを予測するための、動的マルチスケール時空間的グラフ畳み込みネットワークを用いたフィードフォワード深層学習モデルDMS-GCNを提案する。関節、骨、パーツスケールの表現を、準自律的学習済み空間GCNと時間GCNブロックを用いて統合することで、パラメータ数を著しく減らし、推論速度を向上させつつ、Human3.6MおよびCMU Mocapで最先端の性能を達成した。

ABSTRACT

Human motion prediction is an important and challenging task in many computer vision application domains. Recent work concentrates on utilizing the timing processing ability of recurrent neural networks (RNNs) to achieve smooth and reliable results in short-term prediction. However, as evidenced by previous work, RNNs suffer from errors accumulation, leading to unreliable results. In this paper, we propose a simple feed-forward deep neural network for motion prediction, which takes into account temporal smoothness and spatial dependencies between human body joints. We design a Multi-scale Spatio-temporal graph convolutional networks (GCNs) to implicitly establish the Spatio-temporal dependence in the process of human movement, where different scales fused dynamically during training. The entire model is suitable for all actions and follows a framework of encoder-decoder. The encoder consists of temporal GCNs to capture motion features between frames and semi-autonomous learned spatial GCNs to extract spatial structure among joint trajectories. The decoder uses temporal convolution networks (TCNs) to maintain its extensive ability. Extensive experiments show that our approach outperforms SOTA methods on the datasets of Human3.6M and CMU Mocap while only requiring much lesser parameters. Code will be available at https://github.com/yzg9353/DMSGCN.

研究の動機と目的

  • RNNベースの人間の動き予測モデルにおける誤差蓄積と情報損失を解消すること。
  • GCNにおける準自律的学習済み隣接行列の導入により、人間の体の関節間の空間的依存関係のモデリングを向上させること。
  • 時間的グラフ畳み込みネットワーク(TGCN)とフレーム間関節接続を用いることで、時間的モデリングを強化すること。
  • 関節、骨、パーツレベルの表現を統合する動的マルチスケールアーキテクチャを構築し、動きの安定性と予測精度を向上させること。
  • 従来の手法と比較して、モデルの複雑さを低減し、より速い推論速度を達成すること。

提案手法

  • クラスタリングと平均プーリングを用いて、粗いレベルの表現を得るために、関節、骨、パーツの3つのスケールに人間のポーズを要約する。
  • 学習可能なマスクを隣接行列に適用する準自律的学習済み空間GCNを設計し、長距離のメッセージパッシングを制限し、適応的な関節接続学習を可能にする。
  • 連続するフレーム間の関節を接続する時間的エッジを構築し、時間的グラフ畳み込みを可能にすることで、時間軸に沿った情報伝達を実現する。
  • 二重ストリームのエンコーダ-デコーダフレームワークを採用する:エンコーダは時間的GCNと準自律的空間GCNを用いて時空間的特徴を抽出し、デコーダは時間的畳み込みネットワーク(TCN)を用いて、安定した将来のフレーム生成を実現する。
  • ネットワーク内での学習可能なアテンションまたは連結メカニズムを用いて、マルチスケール表現の動的統合を実装する。
  • エラー蓄積がRNNで一般的に見られるのを避けるために、エンドツーエンドでフィードフォワード方式で全モデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1誤差蓄積を回避できるフィードフォワードアーキテクチャは、RNNベースのモデルを上回る人間の動き予測を達成できるか?
  • RQ2マルチスケール時空間的GCNアーキテクチャは、階層的な人間の動き表現をモデリングするのにどの程度有効か?
  • RQ3空間GCNにおける準自律的学習済み隣接行列は、情報の減衰や局所最適解の回避により、動き予測を向上させることができるか?
  • RQ4フレーム間関節接続を持つ時間的GCNブロックは、標準的なGCNと比較して、時間的モデリングをどの程度向上させるか?
  • RQ5提案手法は、最小限のパラメータオーバーヘッドで、多様なアクションやデータセットに一般化可能か?

主な発見

  • DMS-GCNは、Human3.6Mデータセットで最先端の性能を達成し、短期的および長期的動き予測の両方で、先行手法を上回った。
  • CMU Mocapデータセットでは、短期的予測で最高の結果を達成し、最終フレームでのわずかな劣化が見られるものの、長期的予測においても高い信頼性を示した。
  • パラメータ数が著しく少なく、既存のSOTA手法よりも少ないにもかかわらず、トレーニングのパラメータ数と時間コストの比較により、推論速度が速いことが確認された。
  • アブレーションスタディの結果、マルチスケールアーキテクチャが性能向上に寄与しており、3スケールを含む完全なモデルが、スケール数を減らしたバージョンよりも優れた性能を示した。
  • 空間GCNにおけるマスクを除去すると性能が低下し、準自律的学習メカニズムの有効性が裏付けられた。
  • 時間的GCNブロックを除去すると、性能が著しく低下し、時間的グラフ畳み込みが動きのダイナミクスをモデリングする上で極めて重要な役割を果たしていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。