[論文レビュー] We are More than Our Joints: Predicting how 3D Bodies Move
MOJOは、関節ベースの表現を疎なボディ表面マーカーに置き換えることで、動きのリアリズムとボディの妥当性を向上させる、3次元人体運動予測の新規フレームワークを提案する。条件付き変分オートエンコーダを用い、潜在空間に離散コサイン変換(DCT)を適用し、再帰的なSMPL-Xフィッティングを組み合わせることで、多様で高周波数の動きを生成しながら、解剖学的に妥当なボディ形状を維持する。AMASSデータセット上で最先端の結果を達成し、足のスケーティングや骨の変形が大幅に低減された。
A key step towards understanding human behavior is the prediction of 3D human motion. Successful solutions have many applications in human tracking, HCI, and graphics. Most previous work focuses on predicting a time series of future 3D joint locations given a sequence 3D joints from the past. This Euclidean formulation generally works better than predicting pose in terms of joint rotations. Body joint locations, however, do not fully constrain 3D human pose, leaving degrees of freedom undefined, making it hard to animate a realistic human from only the joints. Note that the 3D joints can be viewed as a sparse point cloud. Thus the problem of human motion prediction can be seen as point cloud prediction. With this observation, we instead predict a sparse set of locations on the body surface that correspond to motion capture markers. Given such markers, we fit a parametric body model to recover the 3D shape and pose of the person. These sparse surface markers also carry detailed information about human movement that is not present in the joints, increasing the naturalness of the predicted motions. Using the AMASS dataset, we train MOJO, which is a novel variational autoencoder that generates motions from latent frequencies. MOJO preserves the full temporal resolution of the input motion, and sampling from the latent frequencies explicitly introduces high-frequency components into the generated motion. We note that motion prediction methods accumulate errors over time, resulting in joints or markers that diverge from true human bodies. To address this, we fit SMPL-X to the predictions at each time step, projecting the solution back onto the space of valid bodies. These valid markers are then propagated in time. Experiments show that our method produces state-of-the-art results and realistic 3D body animations. The code for research purposes is at https://yz-cnsdqz.github.io/MOJO/MOJO.html
研究の動機と目的
- 関節ベースの3次元運動予測の限界を解消する。これは、肢の回転を制約できず、時間経過とともに非現実的なボディ形状を生じさせる。
- 関節位置だけでは捉えきれない微細で高周波数の身体運動をモデル化することで、運動のリアリズムを向上させる。
- 各時刻で予測されたマーカーを有効な3次元ボディの多様体上に投影することで、予測された運動が解剖学的に妥当なままであることを保証する。
- マーカーに基づく表現が関節ベースの手法に比べ、運動の自然さと幾何的妥当性において優れていることを実証する。
- 完全な時間分解能を維持し、多様で高周波数の運動サンプリングを可能にする生成モデルを開発する。
提案手法
- MOJOは、従来の関節ベースの表現に代わり、ボディ表面に配置された疎な3次元マーカーを用いて人体運動を表現する。
- 運動周波数を独立にモデル化できるように、離散コサイン変換(DCT)を用いて分解された潜在空間を持つ条件付き変分オートエンコーダ(CVAE)を採用する。
- 潜在事前分布を低周波成分に偏らせるために、強力なカルバック・ライブラー発散(KLD)項を用い、低帯域では多様な潜在フロー(DLows)を、高帯域では標準正規分布ノイズを生成する。
- 推論時、MOJOは予測されたマーカーに対して再帰的なSMPL-Xボディモデルフィッティングを実行し、それらを有効なボディ多様体上に再投影することで、幾何的歪みを防ぐ。
- 時間分解能を完全に保持し、高周波数の詳細を含む多様な未来の運動を確率的サンプリング可能である。
- フレームワークはAMASSデータセットで学習され、MPJPE、BDF、足のスケーティング、および知覚スコアなどの指標で評価される。
実験結果
リサーチクエスチョン
- RQ1関節ベースの運動表現をボディ表面マーカーに置き換えることで、3次元人体運動予測のリアリズムと幾何的妥当性が向上するか?
- RQ2DCTを用いた潜在周波数空間で運動をモデル化することで、微細で高周波数の身体運動のモデル化が向上するか?
- RQ3予測されたマーカーを有効なボディ多様体上に再帰的に投影することで、誤差の蓄積を低減し、非現実的なボディ変形を防げるか?
- RQ4関節ベースのベースラインと比較して、マーカーに基づくMOJOフレームワークは、運動の正確性、多様性、知覚的質において優れているか?
- RQ5DCTベースの潜在空間を用いることで、標準的な潜在ベクトルアプローチと比較して、足のスケーティングアーティファクトが低減するか?
主な発見
- MOJOはDCTベースの潜在空間により高周波数の運動成分をモデル化することで、非DCTベースラインに比べて足のスケーティングアーティファクトを顕著に低減した。
- 再帰的SMPL-Xフィッティングスキームにより、予測が時間経過で逸脱しても、骨の変形や不自然なポーズが完全に解消された。
- 67個のマーカー(SSM2配置)を用いることで、少ないマーカーも数や関節のみの表現よりも、すべての指標で性能が向上し、マーカー配置の重要性が示された。
- 細かく精巧な動作を含むBMLhandballデータセットでは、MOJO-DCTバージョンよりMOJOが知覚評価で優れており、詳細な動きにおける高周波数モデル化の利点が裏付けられた。
- 再帰的投影を適用した関節ベースのベースラインでさえ骨の変形を生じるが、MOJOのマーカーに基づくアプローチは、同じスキームでもそのようなアーティファクトを完全に排除した。
- AMASS上では、先行手法と比較して、知覚的質が向上し、幾何的不整合が低減されたという点で、最先端の結果を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。