Skip to main content
QUICK REVIEW

[論文レビュー] Function4D: Real-time Human Volumetric Capture from Very Sparse Consumer RGBD Sensors

Tao Yu, Zerong Zheng|arXiv (Cornell University)|May 5, 2021
Advanced Vision and Imaging参考文献 57被引用数 9
ひとこと要約

Function4D は、3台のスパarsely配置されたコンsumer RGBD センサーのみを用いて、トポロジーを保つボリューメトリックな統合と、詳細を保持するディープな暗黙関数を組み合わせることで、リアルタイムでの人間ボリューメトリックキャプチャを実現する。従来の手法と比較して、再構築品質、時間的整合性、効率性に優れ、高速な動きや全身の遮蔽といった困難な状況下でも性能を発揮する。

ABSTRACT

Human volumetric capture is a long-standing topic in computer vision and computer graphics. Although high-quality results can be achieved using sophisticated off-line systems, real-time human volumetric capture of complex scenarios, especially using light-weight setups, remains challenging. In this paper, we propose a human volumetric capture method that combines temporal volumetric fusion and deep implicit functions. To achieve high-quality and temporal-continuous reconstruction, we propose dynamic sliding fusion to fuse neighboring depth observations together with topology consistency. Moreover, for detailed and complete surface generation, we propose detail-preserving deep implicit functions for RGBD input which can not only preserve the geometric details on the depth inputs but also generate more plausible texturing results. Results and experiments show that our method outperforms existing methods in terms of view sparsity, generalization capacity, reconstruction quality, and run-time efficiency.

研究の動機と目的

  • 非常にスパarselyな(3台のみ)コンsumer レベルの RGBD センサーを用いて、リアルタイムかつ高精細な人間ボリューメトリックキャプチャを可能にすること。
  • 密度の高いカメラアレイ、高価なセンサーや長期的なトラッキングに依存する既存のシステムの限界を克服すること。
  • 高速な動き、衣装の変更、多人数の相互作用といった複雑なシナリオにおいても、時間的整合性があり幾何学的に詳細な再構築を達成すること。
  • 長期的な非剛性トラッキングに依存するのを減らすために、短時間のボリューミック統合とディープな暗黙関数を統合すること。
  • 今後のリアルタイム3次元人間再構築分野の研究を促進するために、500件の高解像度スキャンを公開するデータセットを提供すること。

提案手法

  • 時間的統合をスライディングウィンドウ内に制限するためのダイナミックスライディング統合が導入され、トラッキング誤差やトポロジーの変化に対して耐性を高めつつ、時間的連続性を維持する。
  • ノイズの多い深度入力からの幾何的詳細を保持するために、切り捨てられたプロジェクティブ符号付き距離関数(PSDF)特徴が明示的に符号化されている。
  • 多視点自己注意メカニズムが特徴集約段階に組み込まれ、相関を考慮した動的統合により、多視点の幾何学的およびテクスチャ特徴を融合可能にしている。
  • 融合されたボリューミックデータから詳細な表面を再構築するためのディープな暗黙関数ネットワーク(GeoNet)が訓練されており、精度向上のためPSDF値を明示的に使用している。
  • ColorNet は、類似した注意ベースのアーキテクチャを用いて、多視点RGB入力から高品質で現実的なテクスチャを推定している。
  • ボリューミック統合と暗黙的ニューラル表現を統合したパイプラインにより、コンsumer ハードウェアでもリアルタイム推論が可能になっている。

実験結果

リサーチクエスチョン

  • RQ13台のコンsumer RGBD センサーのみを用いて、リアルタイムかつ高品質な人間ボリューミックキャプチャを達成できるか?
  • RQ2動的シーンにおけるトポロジーの変化や長期的なトラッキング誤差に対して、ボリューミック統合をどのようにして耐性を持たせるか?
  • RQ3スパarselyでノイズの多い深度入力を受け取った場合に、ディープな暗黙関数が幾何的詳細を効果的に保持し、現実的なテクスチャを生成できるか?
  • RQ4切り捨てられたPSDF符号化が、再構築精度と効率性を向上させる役割を果たすか?
  • RQ5多視点自己注意機構は、テクスチャおよび幾何再構築のための特徴集約をどのように改善するか?

主な発見

  • Function4D は3台のセンサー構成でも最先端の再構築品質を達成し、視野のスパarseness、一般化性能、実行効率の面で既存手法を上回っている。
  • ダイナミックスライディング統合法によりノイズが低減され、トポロジーの一貫性が向上し、深刻な遮蔽や運動下でも完全で時間的に連続した再構築が可能になっている。
  • 切り捨てられたPSDF特徴の使用により、PSDFを用いないモデルと比較して、チェンファーディスタンスで28%の精度向上(1.678 vs. 2.359×10⁻³)を達成している。
  • ColorNetにおける注意ベースの特徴集約は、視界境界付近において特に顕著にテクスチャ品質を向上させ、より明確で現実的な結果を生成している。
  • GeoNet は1フレームあたり約80秒で高精細な表面を再構築しており、より複雑な入力を用いているにもかかわらず、IPNet よりも桁違いに高速である。
  • 本手法は、着替え、服を脱ぐ、多人数の相互作用といった困難なシナリオを効果的に処理できており、テンプレートベースや長期トラッキング依存の手法が苦手とする状況でも成功している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。