[論文レビュー] DeepCap: Monocular Human Performance Capture Using Weak Supervision
DeepCapは、マルチビュー映像とパーソナライズドテンプレートメッシュのみを用いて、3次元骨格姿勢と非剛性表面変形を同時に回帰する弱教師付き深層学習手法を提案する。微分可能レンダリングと分析・合成による訓練により、3次元幾何再構成の精度と時間的整合性が図られ、特に困難なポーズ下でも優れた性能を発揮し、最先端の性能を達成した。
Human performance capture is a highly important computer vision problem with many applications in movie production and virtual/augmented reality. Many previous performance capture approaches either required expensive multi-view setups or did not recover dense space-time coherent geometry with frame-to-frame correspondences. We propose a novel deep learning approach for monocular dense human performance capture. Our method is trained in a weakly supervised manner based on multi-view supervision completely removing the need for training data with 3D ground truth annotations. The network architecture is based on two separate networks that disentangle the task into a pose estimation and a non-rigid surface deformation step. Extensive qualitative and quantitative evaluations show that our approach outperforms the state of the art in terms of quality and robustness.
研究の動機と目的
- 3次元の真値アノテーションを必要とせず、単眼映像からの高密度かつ空間時間的に整合性のある3次元人体パフォーマンスキャプチャを実現すること。
- 従来の単眼手法が全身の非剛性変形を捉えられなかったり、時間的整合性に欠けたりするという限界を克服すること。
- 3次元アノテーションの代わりにマルチビュー画像とテンプレートメッシュのみを用いる弱教師付き学習パラダイムを構築すること。
- グラフィックス互換性があり、四肢を保持する再構成を可能にする、微分可能でメッシュベースの表現を生成すること。
- 遮蔽や平面外の運動下でも、複雑な衣装や身体の変形を高精度に再構成できること。
提案手法
- 本手法は2ストリームの畳み込みニューラルネットワークアーキテクチャを採用する。1つのストリーム(PoseNet)は骨格姿勢を予測し、もう1つのストリーム(DefNet)はメッシュベースの変形グラフの変形パラメータを予測する。
- モデルは、予測された3次元メッシュを2次元画像空間に再投影する完全に微分可能なレンダリング層を採用しており、マルチビュー一貫性を用いた監視が可能である。
- 訓練は分析・合成のアプローチを採用し、3次元監視を一切不要としつつ、予測された2次元観測値と真値のマルチビュー画像を比較することで行う。
- 変形グラフはメッシュに埋め込まれ、ノードごとに回転と並進をパラメータ化することで、局所的な非剛性表面変形を可能にする。
- パーソナライズドテンプレートメッシュを用い、1回の順伝播でポーズと変形を同時に回帰することで、時間的整合性を確保する。
- 損失関数は、マルチビュー映像からの2次元監視のみを用いてエンドツーエンドで最適化され、弱教師付き学習が実現される。
実験結果
リサーチクエスチョン
- RQ1単眼の深層学習モデルは、3次元真値アノテーションがなくても、全身の人体運動および非剛性表面変形の正確で空間時間的に整合性のある3次元再構成を達成できるか?
- RQ2マルチビュー映像からの弱教師付き学習は、完全に教師付き手法と比較して、3次元幾何再構成の精度と耐性に優れているか?
- RQ3微分可能なメッシュ表現は、遮蔽や複雑なポーズ下でも安定的かつ四肢を保持する再構成を可能にするか?
- RQ4変形グラフの統合は、ポーズのみまたはスキンニングベースの手法と比較して、再構成の忠実度をどの程度向上させるか?
- RQ5トレーニングに使用する視点数やフレーム数の増加が、学習された3次元再構成の品質に与える影響はどの程度か?
主な発見
- S1シーケンスでは、DeepCapは87.2%のAMVIoUと89.26%のSVIoUを達成し、すべての先行単眼手法を上回り、マルチビューベースライン(91.74% AMVIoU)に近づいた。
- S4シーケンスでは、DeepCapは82.53%のAMVIoUと86.66%のSVIoUを達成し、LiveCap(59.96% AMVIoU)およびHMR(65.1% AMVIoU)を大きく上回った。
- トレーニング時にカメラ視点を増やすと、AMVIoUは1視点の65.11%から7視点の81.73%に向上し、マルチビュー監視の有効性が示された。
- トレーニングデータを1/4から全フレームに増やすと、AMVIoUは73.41%から82.53%に向上し、データ効率性と一般化性能の向上が確認された。
- PoseNetのみと比較して、DefNetの導入によりAMVIoUは約4%向上し、特にゆるい衣装やスキンニングアーチファクトの修正に効果的であった。
- S4シーケンスでは96.74%の3DPCKを達成し、最高性能のベースラインと同等のポーズ精度を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。