Skip to main content
QUICK REVIEW

[論文レビュー] SoMoFormer: Multi-Person Pose Forecasting with Transformers

Edward Vendrow, Satyajit Kumar|arXiv (Cornell University)|Aug 30, 2022
Human Pose and Action Recognition被引用数 11
ひとこと要約

SoMoFormerは、時間系列予測ではなく、関節軌道モデリングとしてポーズ予測を再定式化することで、複数人3次元人体ポーズ予測のための新しいTransformerベースの手法を提案する。すべての身体関節の複数人 across の軌道にわたる関節に配慮した自己注意機構を用い、相互の関節間および人物間のダイナミクスをよりよくモデル化することで、並列的かつ長期的な運動予測を可能にし、SoMoF、CMU-Mocap、MuPoTS-3Dベンチマークで最先端の性能を達成した。

ABSTRACT

Human pose forecasting is a challenging problem involving complex human body motion and posture dynamics. In cases that there are multiple people in the environment, one's motion may also be influenced by the motion and dynamic movements of others. Although there are several previous works targeting the problem of multi-person dynamic pose forecasting, they often model the entire pose sequence as time series (ignoring the underlying relationship between joints) or only output the future pose sequence of one person at a time. In this paper, we present a new method, called Social Motion Transformer (SoMoFormer), for multi-person 3D pose forecasting. Our transformer architecture uniquely models human motion input as a joint sequence rather than a time sequence, allowing us to perform attention over joints while predicting an entire future motion sequence for each joint in parallel. We show that with this problem reformulation, SoMoFormer naturally extends to multi-person scenes by using the joints of all people in a scene as input queries. Using learned embeddings to denote the type of joint, person identity, and global position, our model learns the relationships between joints and between people, attending more strongly to joints from the same or nearby people. SoMoFormer outperforms state-of-the-art methods for long-term motion prediction on the SoMoF benchmark as well as the CMU-Mocap and MuPoTS-3D datasets. Code will be made available after publication.

研究の動機と目的

  • 従来の手法が単一人物のポーズを逐次的に予測するか、時間系列としてポーズをモデル化するが、関節レベルのダイナミクスや社会的相互作用を無視するという制限に対処する。
  • 1回のフォワードパスで複数人の未来の運動シーケンスをエンドツーエンドで並列に予測することを可能にする。
  • 関節の軌道に注目したアテンション機構を用いて、複数人シーンにおける身体関節同士および人物同士の複雑な関係をモデル化する。
  • 時間系列ポーズから関節軌道シーケンスへの入力表現の再考により、長期的な運動予測の精度を向上させる。
  • 明示的なグラフ構造や再帰モジュールを用いずに、関節に配慮したアテンションが人間の身体ダイナミクスと社会的相互作用を効果的に捉えることができるかを示す。

提案手法

  • 各関節の未来の軌道を個別に予測するようにポーズ予測を再定式化し、各関節のDCT符号化された軌道を別々の入力トークンとして扱う。
  • 関節タイプ、人物ID、グローバルな空間的位置を学習可能な埋め込みとして用い、各関節トークンを強化する。
  • 標準的なTransformerエンコーダーを用い、関節トークン間の多頭部自己注意機構を適用することで、同じまたは異なる人物の関節間での注目を可能にする。
  • グリッド位置埋め込みを連結して、人物間の空間的近接性とグローバルなシーンレイアウトをモデル化する。
  • 全人物の関節軌道を一度のフォワードパスで同時に処理し、逐次的または反復的な予測を回避する。
  • Transformerの並列性を活かして、再帰を用いず、長期的な時間軸にわたって累積誤差を低減した完全な未来ポーズシーケンスを予測する。

実験結果

リサーチクエスチョン

  • RQ1時間系列予測ではなく関節軌道予測としてポーズ予測を定式化することで、複数人シナリオにおける長期的運動予測の精度が向上するか?
  • RQ2明示的なグラフ構造がなくても、自己注意機構が関節間および人物間の関係をどれほど効果的に捉えることができるか?
  • RQ3運動予測の過程で、物理的に近接しているか、動的に関連する関節に強く注目するようモデルが学習するか?
  • RQ4異なる人数の人物や多様な運動パターンに一般化でき、高い性能を維持できるか?
  • RQ5アテンション重みが、複数人運動における現実的な人間の身体ダイナミクスと社会的相互作用をどのように反映しているか?

主な発見

  • SoMoFormerはSoMoFベンチマークで最先端の手法を上回り、長期的3次元ポーズ予測において新たなSOTAを達成した。
  • CMU-MocapおよびMuPoTS-3Dデータセットでも優れた性能を示し、多様な運動シーケンスにわたる強力な一般化能力を確認した。
  • アテンション可視化の結果、足から股関節、手から体幹への関節間の近くにあり機能的に関連する関節に強く注目していることがわかった。これは現実的な身体ダイナミクスを反映している。
  • 明示的な対称性の誘導バイアスがなくても、左・右の身体側に対称的なアテンションパターンを学習していた。
  • 人物間の距離が増加するにつれて、人物間のアテンションスコアが低下しており、社会的相互作用ダイナミクスをモデルが正しく捉えていることが確認された。
  • 定性的な結果から、SoMoFormerは、並行して歩行する複雑な複数人シナリオでも、現実的で時間的に整合性のある運動シーケンスを生成していることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。