Skip to main content
QUICK REVIEW

[論文レビュー] Learning Variational Motion Prior for Video-based Motion Capture

Xin Chen, Zhuo Su|arXiv (Cornell University)|Oct 27, 2022
Advanced Vision and Imaging被引用数 5
ひとこと要約

本論文では、大規模な3次元モーショングラフデータ上で変分オートエンコーダー(VAE)を用いて学習された変分運動プリア(VMP)を提案し、モノクロナルビデオベースの人体モーショングラフを改善する。連続的な潜在空間における包括的でシーケンスレベルの運動プリアをモデル化し、ビデオエンコーダーと統合することでエンドツーエンドの微調整が可能となり、3DPWでは10mm以上の誤差低減が達成され、ベンチマークおよびイン・ザ・ワイルドな設定において最先端の性能を達成した。

ABSTRACT

Motion capture from a monocular video is fundamental and crucial for us humans to naturally experience and interact with each other in Virtual Reality (VR) and Augmented Reality (AR). However, existing methods still struggle with challenging cases involving self-occlusion and complex poses due to the lack of effective motion prior modeling. In this paper, we present a novel variational motion prior (VMP) learning approach for video-based motion capture to resolve the above issue. Instead of directly building the correspondence between the video and motion domain, We propose to learn a generic latent space for capturing the prior distribution of all natural motions, which serve as the basis for subsequent video-based motion capture tasks. To improve the generalization capacity of prior space, we propose a transformer-based variational autoencoder pretrained over marker-based 3D mocap data, with a novel style-mapping block to boost the generation quality. Afterward, a separate video encoder is attached to the pretrained motion generator for end-to-end fine-tuning over task-specific video datasets. Compared to existing motion prior models, our VMP model serves as a motion rectifier that can effectively reduce temporal jittering and failure modes in frame-wise pose estimation, leading to temporally stable and visually realistic motion capture results. Furthermore, our VMP-based framework models motion at sequence level and can directly generate motion clips in the forward pass, achieving real-time motion capture during inference. Extensive experiments over both public datasets and in-the-wild videos have demonstrated the efficacy and generalization capability of our framework.

研究の動機と目的

  • 自己遮蔽や複雑なポーズ下でも不安定でジッタリーな3次元ポーズ推定が生じるモノクロナルビデオベースのモーショングラフの課題に対処すること。
  • フレームレベルやアクティビティ条件付きのプリアを越えて、人間の運動の包括的で時間的特性を捉える汎用的かつシーケンスレベルの運動プリアを学習すること。
  • 事前学習された潜在運動プリアを補正器として活用することで、イン・ザ・ワイルドな動画における一般化性能と現実性を向上させること。
  • 1回の順伝播で完全なモーショングラフクリップを直接生成することで、リアルタイムのモーショングラフを実現すること。
  • タスク固有の監視に依存するのを減らすために、ビデオ-モーショングラフペアを用いずに、大規模なマーカー付きモーショングラフデータ上でプリアを事前学習すること。

提案手法

  • AMAASデータセット上で変分オートエンコーダー(VAE)を訓練し、自然な人体運動シーケンスの分布を表す連続的かつ表現力豊かな潜在空間を学習する。
  • アダプティブインスタンス正規化(AdaIN)を用いた新規なスタイルマッピングブロックが、潜在コードの表現力と生成品質を向上させる。
  • 別個の空間時系列変換器アーキテクチャを備えたビデオエンコーダーをエンドツーエンドで微調整し、入力ビデオクリップを事前学習済みVMP潜在空間にマッピングする。
  • トレーニングの安定化とポーズ精度の向上を図るため、KLダイバージェンス、再構成損失、および四肢長さ正則化を組み合わせたマルチ損失トレーニング目的関数を採用する。
  • 2段階のトレーニング戦略により、プリア学習とビデオ固有の適応を分離し、未観測のアクションや複雑な運動に対しても頑健な一般化を可能にする。
  • VMPはモーショングラフ補正器として機能し、時間的ジッタの低減とフレーム単位のポーズ推定の一貫性向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1シーケンスレベルで連続的な潜在運動プリアは、モノクロナルビデオベースの3次元モーショングラフの安定性と現実性を向上させ得るか?
  • RQ2AdaINスタイルマッピングを用いた変換器ベースのVAEは、複雑な人間の運動ダイナミクスをどれほど効果的にモデル化できるか?
  • RQ3事前学習済み運動プリアは、未観測のアクションやイン・ザ・ワイルドな動画シナリオにどの程度一般化可能か?
  • RQ4運動プリアにより、反復的最適化なしに1回の順伝播で完全なモーショングラフクリップをリアルタイムに生成できるか?
  • RQ5VMPベースのフレームワークは、困難なベンチマークにおいて、既存の運動プリアモデルと比較して精度と一般化性能に優れているか?

主な発見

  • 提案されたVMPフレームワークは、3DPWベンチマークにおいてベースライン手法と比較してPA-MPJPEを10mm以上低減し、新たな最先端の性能を達成した。
  • ユーザースタディの結果、動きの自然さに関する平均意見スコア(MOS)は3.99であり、ACTORと比較して1.5ポイントの向上を示し、優れた知覚的品質を示した。
  • アブレーションスタディの結果、AdaINブロックおよび非線形マッピングコンponentの両方が不可欠であることが確認され、それらを除去するとMOSはそれぞれ3.74および3.73に低下した。
  • フレームワークは1回の順伝播で完全なモーショングラフクリップを生成し、反復的リファインメントなしにリアルタイム推論を達成した。
  • グローバルトラジェクトリの監視を受けていないにもかかわらず、VIBEとの比較で妥当なグローバルモーショントレースを予測することができ、VMPベースのシステムの有効性が示された。
  • 連続的かつ表現力豊かな潜在空間のおかげで、フィットネスとバレエの間の遷移など、未観測のアクションに対しても良好な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。