Skip to main content
QUICK REVIEW

[論文レビュー] Learning Motion Priors for 4D Human Body Capture in 3D Scenes

Siwei Zhang, Yan Zhang|arXiv (Cornell University)|Aug 23, 2021
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、複雑な3次元シーンにおける単眼RGB(D)動画からの4次元人体モーションキャプチャを向上させるために、AMASSデータセットからモーション事前分布を学習するLEMOという手法を提案する。データ駆動型のモーション滑らかさ事前分布と、インスタンスごとに自己教師付きで学習する接触感知型モーション補完器を組み合わせることで、ジャイターや足スケーティングのアーチファクトを低減し、従来手法よりも滑らかで自然かつ遮蔽に強いモーション再構成を実現する。

ABSTRACT

Recovering high-quality 3D human motion in complex scenes from monocular videos is important for many applications, ranging from AR/VR to robotics. However, capturing realistic human-scene interactions, while dealing with occlusions and partial views, is challenging; current approaches are still far from achieving compelling results. We address this problem by proposing LEMO: LEarning human MOtion priors for 4D human body capture. By leveraging the large-scale motion capture dataset AMASS, we introduce a novel motion smoothness prior, which strongly reduces the jitters exhibited by poses recovered over a sequence. Furthermore, to handle contacts and occlusions occurring frequently in body-scene interactions, we design a contact friction term and a contact-aware motion infiller obtained via per-instance self-supervised training. To prove the effectiveness of the proposed motion priors, we combine them into a novel pipeline for 4D human body capture in 3D scenes. With our pipeline, we demonstrate high-quality 4D human body capture, reconstructing smooth motions and physically plausible body-scene interactions. The code and data are available at https://sanweiliti.github.io/LEMO/LEMO.html.

研究の動機と目的

  • 複雑な3次元シーンにおける部分的視認や遮蔽が再構成品質を低下させる状況下で、単眼RGB(D)シーケンスから高品質で自然な人体モーションを再構成する課題に対処すること。
  • PROXのような既存の単眼キャプチャパイプラインで一般的に見られるモーションジャイターや足スケーティングアーチファクトを低減すること。
  • 接触ダイナミクスと全身モーションを統合的にモデル化することで、4次元再構成における人体-シーン相互作用のリアリズムと物理的妥当性を向上させること。
  • 部分観測を持つ特定のテストインスタンスに適応するための自己教師付きでインスタンスごとのファインチューニング戦略を構築すること。
  • データ駆動型事前分布を用いて、単眼RGB(D)キャプチャとハイエンドのマーカー付きモーションキャプチャシステムとの性能ギャップを埋めること。

提案手法

  • 完全畳み込みオートエンコーダーが、広い空間的・時間的受容fieldを持つ潜在空間で、全身のダイナミクスを包括的に捉えるモーション滑らかさ事前分布を学習する。
  • 関節ではなく表面マーカーを用いてボディモーションを表現することで、四肢の回転や自由度のモデリングが向上する。
  • AMASS上で学習された接触感知型モーション補完器は、同時にボディモーションと足-地面接触状態を予測し、足スケーティングアーチファクトを低減する。
  • インスタンスごとに自己教師付きでファインチューニングするスキームにより、可視部位のみの損失を最小化することで、事前学習済み補完器をテストシーケンスに適応させる。
  • 物理的接触摩擦項を統合することで、足-地面相互作用の正則化をさらに強化し、物理的妥当性を向上させる。
  • モーション事前分布、接触モデリング、SMPL-Xフィッティングを統合した段階的最適化パイプラインにより、滑らかで正確かつ遮蔽に強い4次元人体モーションを再構成する。

実験結果

リサーチクエスチョン

  • RQ1大規模なモーションキャプチャデータから学習したデータ駆動型モーション滑らかさ事前分布は、単眼4次元人体モーション再構成におけるジャイターや時間的整合性の向上に顕著な効果をもたらすか?
  • RQ2AMASSで学習した接触感知型モーション補完器は、遮蔽された部位を効果的に再構成し、現実的な足-地面相互作用を維持するとともに、スケーティングアーチファクトを低減できるか?
  • RQ3インスタンスごとの自己教師付きファインチューニングにより、部分観測を持つ個々のテストシーケンスに、固定事前分布よりも効果的に適応できるか?
  • RQ4モーション事前分布と接触モデリングの統合は、複雑な3次元シーンにおける人体-シーン相互作用のリアリズムと物理的妥当性をどのように向上させるか?
  • RQ5提案されたパイプラインは、単眼RGB(D)入力のみで、マーカー付きモーションキャプチャシステムと同等の再構成品質を達成できるか?

主な発見

  • 提案されたモーション滑らかさ事前分布は、PROXおよび3DPWデータセットの両方でジャイタを低減し、再構成品質を向上させ、MPJPE、MPMPE、PVE指標において測定可能な向上を示した。
  • 接触感知型モーション補完器は、ヒューリスティックな接触ルールを上回り、足スケーティング比を低減し、遮蔽部位の再構成誤差(MPJPE-LおよびMPMPE-L)も低く抑えた。
  • 自己教師付きインスタンスごとのファインチューニングは、全身および遮蔽部位の両方の指標で一貫して性能向上を示し、個々のテストインスタンスへの効果的な適応を実証した。
  • パイプラインに統合された際、補完器はベースライン手法と比較して、PROXデータセットにおける2D関節精度を向上させるとともに、PSKLおよび非衝突スコアを低減した。
  • 段階の順序を入れ替えた実験では、ジャイタ渋いPROX出力に補完器を適用した場合に性能が著しく低下したため、補完の前にモーションスムージングが不可欠であることが確認された。
  • アブレーションスタディにより、接触感知型補完器と自己教師付きファインチューニングの両方が重要であり、いずれかを除去すると性能が著しく低下することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。