Skip to main content
QUICK REVIEW

[論文レビュー] LiveCap: Real-time Human Performance Capture from Monocular Video

Marc Habermann, Weipeng Xu|arXiv (Cornell University)|Oct 5, 2018
3D Shape Modeling and Analysis参考文献 95被引用数 9
ひとこと要約

LiveCapは、1台のRGBビデオから、全身の動きと、ゆったりとした衣服を含む、高密度で時空間的に整合性のある3次元再構成を、初めてリアルタイムで実現する単眼手法を提示する。GPUアクセラレートでデータ並列なガウス・ニュートンソルバーを用いた2段階最適化により、2D/3D関節、顔面の特徴点、シルエットにスキンデフォーメーションテンプレートを同時に適合させた後、素材に配慮したエネルギー関数を用いて高密度な非剛性変形をトラッキングする。これにより、25Hzを超える性能を達成し、オフライン手法と同等の精度を実現する。

ABSTRACT

We present the first real-time human performance capture approach that reconstructs dense, space-time coherent deforming geometry of entire humans in general everyday clothing from just a single RGB video. We propose a novel two-stage analysis-by-synthesis optimization whose formulation and implementation are designed for high performance. In the first stage, a skinned template model is jointly fitted to background subtracted input video, 2D and 3D skeleton joint positions found using a deep neural network, and a set of sparse facial landmark detections. In the second stage, dense non-rigid 3D deformations of skin and even loose apparel are captured based on a novel real-time capable algorithm for non-rigid tracking using dense photometric and silhouette constraints. Our novel energy formulation leverages automatically identified material regions on the template to model the differing non-rigid deformation behavior of skin and apparel. The two resulting non-linear optimization problems per-frame are solved with specially-tailored data-parallel Gauss-Newton solvers. In order to achieve real-time performance of over 25Hz, we design a pipelined parallel architecture using the CPU and two commodity GPUs. Our method is the first real-time monocular approach for full-body performance capture. Our method yields comparable accuracy with off-line performance capture techniques, while being orders of magnitude faster.

研究の動機と目的

  • 1台のRGBビデオストリームから、全身の人体運動と変形をリアルタイムで高密度な3次元再構成すること。
  • 分離された皮膚と衣類領域を有する事前学習済みテンプレートを活用することで、単眼ビデオの高い曖昧さと不十分な制約を克服すること。
  • 25Hzを超えるリアルタイム性能を達成しながら、時空間的整合性と高い幾何的正確性を維持すること。
  • マルチビューまたは深度センサーを必要とせず、複雑でゆったりとした衣類の変形を扱えること。
  • 専用のカメラアレイや制御された環境を不要にするなど、高品質なパフォーマンスキャプチャを一般化すること。

提案手法

  • 2段階の解析・合成最適化:まず、リアルタイムのスケルトンポーズ最適化器を用いて、スキンデフォーメーションテンプレートを2D/3D関節位置、顔面特徴点、前面シルエットに粗く適合させる。
  • 2番目の段階では、光度、シルエット、空間的・時間的正則化項を組み合わせた新しいエネルギー定式化を用いて、高密度な非剛性トラッキングを実行する。
  • 事前処理で実行されるマルチビュー深層学習ベースのセグメンテーションパイプラインから得たセグメンテーションラベルを用いて、皮膚と衣類の間で変形挙動を区別する。
  • 非線形最適化問題は、CPUと2つのGPUをパイプラインアーキテクチャで使用する、特別に調整されたデータ並列ガウス・ニュートンソルバーで解く。
  • ICPに代わる距離関数ベースのシルエット整合化により、高速でGPUフレンドリーな計算が可能になり、高価な対応関係探索を回避する。
  • 事前にキャプチャされた静止ビデオを用いて、ラジエーテッド表面と外観テンプレートを自動で特定された素材領域と共に構築する。

実験結果

リサーチクエスチョン

  • RQ11台の単眼RGBビデオストリームから、高密度で時空間的に整合性のある3次元人体幾何をリアルタイムに再構成できるか?
  • RQ21つの視点しか利用できない状況で、ゆったりとした衣類の非剛性変形を正確にモデル化・トラッキングできるか?
  • RQ325Hzを超える速度で動作するにもかかわらず、オフラインのマルチビューパフォーマンスキャプチャ手法と同等の性能品質を達成できるか?
  • RQ41視点でリアルタイムに動作する環境で、皮膚と衣類の素材に応じた変形挙動を効果的にモデル化できるか?
  • RQ5一般ハードウェア上でリアルタイム性能を達成するために、どのようなアーキテクチャ的・アルゴリズム的最適化が必要か?

主な発見

  • LiveCapは、一般ハードウェア上で25Hzを超えるリアルタイム性能を達成し、VR、AR、テレプレゼンスなどのインタラクティブなアプリケーションを可能にする。
  • 本手法は、ゆったりとした衣類を含む全身の人体運動に対して、高密度で時空間的に整合性のある3次元再構成を生成し、最先端のオフラインパフォーマンスキャプチャ技術と同等の正確性を達成する。
  • 素材に配慮した変形モデリングの活用により、特に動的で非剛性な衣類の再構成品質が顕著に向上する。
  • 部分的・自己遮蔽に対しても頑健であり、以前に遮蔽されていた領域が再び現れた際に素早く回復する。
  • 制限事項として、不良な前景セグメンテーションへの感受性、学習分布外の極端なポーズ、スペキュラー素材や強い照明変化の処理に課題を抱える。
  • 単眼の曖昧さにもかかわらず、本手法は時間的安定性を維持し、関節予測の誤りを関節最適化を通じて是正する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。