Skip to main content
QUICK REVIEW

[論文レビュー] Synthesizing Long-Term 3D Human Motion and Interaction in 3D Scenes

Jiashun Wang, Huazhe Xu|arXiv (Cornell University)|Dec 10, 2020
Human Pose and Action Recognition参考文献 69被引用数 7
ひとこと要約

本稿では、3Dシーン内の長期的3次元人体運動を合成する階層的生成フレームワークを提案する。まず、条件付き変分オートエンコーダー(CVAE)を用いて3Dシーンの文脈に基づき部分的ゴールポーズを予測し、次に双方向LSTMを用いて短時間の運動シーケンスを生成する。物理的妥当性および人体とシーンの相互作用を保証する明示的な幾何最適化を組み込む。本手法はPROXおよびMP3Dデータセットにおいて、運動のリアルさとシーンへの適合性の面で最先端の性能を達成した。

ABSTRACT

Synthesizing 3D human motion plays an important role in many graphics applications as well as understanding human activity. While many efforts have been made on generating realistic and natural human motion, most approaches neglect the importance of modeling human-scene interactions and affordance. On the other hand, affordance reasoning (e.g., standing on the floor or sitting on the chair) has mainly been studied with static human pose and gestures, and it has rarely been addressed with human motion. In this paper, we propose to bridge human motion synthesis and scene affordance reasoning. We present a hierarchical generative framework to synthesize long-term 3D human motion conditioning on the 3D scene structure. Building on this framework, we further enforce multiple geometry constraints between the human mesh and scene point clouds via optimization to improve realistic synthesis. Our experiments show significant improvements over previous approaches on generating natural and physically plausible human motion in a scene.

研究の動機と目的

  • 長期的3次元人体運動合成における人体-シーン相互作用およびアフォーダンス推論の欠落を解消すること。
  • 運動生成とシーンのアフォーダンスの乖離を解消し、物理的妥当性および接触制約をモデル化すること。
  • 複雑な3次元環境において自然で物理的に妥当かつ多様な長期的人体運動シーケンスを生成すること。
  • 深層学習と明示的な幾何最適化を組み合わせることで運動のリアルさを向上させること。
  • 3次元シーン内の開始・終了位置および部分的ゴールポーズを条件として用いることで、制御可能な運動生成を可能にすること。

提案手法

  • 2段階の階層的フレームワーク:まず、3次元シーンの文脈に基づき、条件付き変分オートエンコーダー(CVAE)を用いてSMPL-Xパラメータによる部分的ゴールポーズを予測する。
  • 次に、SMPL-X表現および3次元シーン入力を用いて、双方向LSTMが部分的ゴール間の短時間運動シーケンスを生成する。
  • フレームワークは、人体の正確な幾何制約とシーンの点群との整合性を保つために微分可能であるSMPL-Xモデルを用いる。
  • 運動の自然さと衝突回避の両立を図るために、人体メッシュとシーンの点群の間で幾何的制約を適用する最適化ベースの精練ステップを実装する。
  • 人体メッシュとシーンの点群の間で、運動の自然さと衝突回避をバランスさせる微分可能最適化プロセスを用いて幾何的制約を適用する。
  • 最終的な長期的運動は、最適化された短時間運動シーケンスをつなぎ合わせることで構成される。

実験結果

リサーチクエスチョン

  • RQ1階層的深層生成モデルは、複雑な3次元シーンにおいて物理的妥当性を保ちながら、長期的3次元人体運動を効果的に合成できるか?
  • RQ2シーンのアフォーダンスと人体の幾何形状をどのように統合的にモデル化することで、運動のリアルさと相互作用を向上させられるか?
  • RQ3明示的な幾何最適化は、学習された運動シーケンスの物理的妥当性をどの程度向上させるか?
  • RQ4PROXで学習したモデルを用いて、MP3Dのような未観測の3次元環境にも一般化可能か?
  • RQ5定量的および定性的に、最先端の運動およびポーズ生成手法と比較して、本手法はどのように優れているか?

主な発見

  • 本手法は6秒の運動シーケンスにおいて、人間評価スコア3.65 ± 0.96を達成し、実測値(3.92 ± 0.91)に近い性能に到達した。
  • 最適化を適用することで、近隣間距離(v2v距離)が8.25に低下し、次善のベースライン(Route+CVAE:21.78)を著しく上回り、実測値(3.59)に近づいた。
  • 接触と衝突回避の両方の指標で最高のスコアを記録し、PROX上ではそれぞれ3.55 ± 0.88および3.30 ± 0.96を達成した。
  • 最適化プロセスにより、ベースラインの性能が著しく向上し、Route+CVAEではv2v距離が最適化なし(10.59)から最適化あり(8.25)に、HSNMSでは10.84から7.31に改善された。
  • 部分的ゴールのボディシェイプ、ポーズ、位置を制御することで、同じ開始・終了パスに対しても多様な運動シーケンスの生成が可能になった。
  • MP3Dデータセットに対しても良好な一般化性能を示し、ランダムにサンプリングされた開始・終了設定に対しても、現実的で環境に適応した運動シーケンスを生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。