[論文レビュー] Generating Smooth Pose Sequences for Diverse Human Motion Prediction
本稿では、正規化フローを用いてポーズ事前分布をモデル化し、関節角度制約によって時間的滑らかさを強制することで、多様で制御可能な人間の動き予測のための統一的深層生成モデルを提案する。本手法は身体部位を段階的に生成するため、エンド・ツー・エンドの学習が可能であり、Human3.6Mで25%高いサンプル多様性と8%低い再構成誤差を達成し、多様性(APD)と正確性(ADE、FDE)の両面で最先端のベースラインを上回る性能を発揮する。
Recent progress in stochastic motion prediction, i.e., predicting multiple possible future human motions given a single past pose sequence, has led to producing truly diverse future motions and even providing control over the motion of some body parts. However, to achieve this, the state-of-the-art method requires learning several mappings for diversity and a dedicated model for controllable motion prediction. In this paper, we introduce a unified deep generative network for both diverse and controllable motion prediction. To this end, we leverage the intuition that realistic human motions consist of smooth sequences of valid poses, and that, given limited data, learning a pose prior is much more tractable than a motion one. We therefore design a generator that predicts the motion of different body parts sequentially, and introduce a normalizing flow based pose prior, together with a joint angle loss, to achieve motion realism.Our experiments on two standard benchmark datasets, Human3.6M and HumanEva-I, demonstrate that our approach outperforms the state-of-the-art baselines in terms of both sample diversity and accuracy. The code is available at https://github.com/wei-mao-2019/gsps
研究の動機と目的
- 多様性と制御性を達成するために複数のマッピングや別々のモデルを必要とする従来の確率的動き予測手法の限界を解消すること。
- VAEベースの手法におけるモード崩壊問題を解消するため、動きレベルの分布の代わりにポーズレベルの事前分布を学習すること。
- 1つのエンド・ツー・エンドでトレーニング可能なモデルを用いて、多様で制御可能な動きを同時に予測すること。
- ポーズ事前分布と関節角度損失を用いてキネマティック制約と時間的整合性を強制することで、現実的で滑らかな動きのシーケンスを保証すること。
- 再トレーニングなしに非制御的多様生成と部分ベースの制御的生成の両方をサポートする統一ソリューションを提供すること。
提案手法
- 正確な対数尤度計算と多様性の向上を可能にするために、有効な人体ポーズの分布をモデル化する正規化フローに基づくポーズ事前分布を提案する。
- 下肢から上肢へと段階的に生成する生成器を導入し、部分ベースの制御を可能にする。
- 不自然な関節配置をペナルティ化する関節角度損失を用いて、時間的滑らかさとキネマティックの現実性を強制する。
- 予測されたポーズペア間の距離を明示的に最大化することで、トレーニング中にサンプル間の多様性を最大化する。
- 特定の身体部位(例:下肢)の潜在コードを固定し、他の部位(例:上肢)を変化させることで、制御可能な生成を実現するための条件付き潜在空間の定式化を用いる。
- 再構成損失、多様性損失、ポーズ事前分布損失、関節角度損失を組み合わせた複合損失を用いて、モデル全体をエンド・ツー・エンドで学習する。
実験結果
リサーチクエスチョン
- RQ1別々のモード用に再トレーニングを行わず、統一的深層生成モデルが多様で制御可能な人間の動き予測を達成できるか?
- RQ2正規化フローを用いてポーズ事前分布をモデル化することで、直接動き分布を学習するのと比較して、より現実的で多様な動きシーケンスが得られるか?
- RQ3身体部位の段階的生成によって、特定の部位に対する正確な制御が可能になりつつも、動きの現実性と多様性を維持できるか?
- RQ4標準ベンチマーク上で、本手法は多様性(APD)と正確性(ADE、FDE)の両面で最先端のアプローチと比較してどのように評価されるか?
- RQ5ポーズ事前分布が欠落している場合、生成された動きシーケンスに現実的でないまたは無効なポーズが生じる程度はどの程度か?
主な発見
- Human3.6Mデータセットでは、最先端のDLow手法と比較して、8%低いADE(再構成誤差)と25%高いAPD(平均ペアワイズ多様性)を達成した。
- ADE、FDE、MMADE、MMFDE、APDのすべての指標で、Human3.6MおよびHumanEva-Iのすべてのベースラインを上回った。
- 定性的な結果から、本手法はDLowよりも現実的で多様な動きを生成していることが示された。DLowは図7の赤枠で示されるように、まれに無効なポーズを生成する。
- 除去実験の結果、ポーズ事前分布損失(L_nf)を除去すると、ポーズ品質(NLL)が著しく低下するが、多様性は高まるため、ポーズ事前分布の必要性が確認された。
- 本手法は、多様な上肢予測においても同一の下肢動きを強制的に維持できるが、DLowは再試行サンプリングを用いないとこの制御を保証できない。その結果、上肢の多様性が低下する。
- 本手法は他の生成器にも一般化可能であり、条件付き定式化をBoMに適応した結果、設計の堅牢性がさらに裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。