Skip to main content
QUICK REVIEW

[論文レビュー] DeepMultiCap: Performance Capture of Multiple Characters Using Sparse Multiview Cameras

Yang Zheng, Ruizhi Shao|arXiv (Cornell University)|May 1, 2021
Advanced Vision and Imaging参考文献 66被引用数 4
ひとこと要約

DeepMultiCapは、事前スキャン済みテンプレートを必要とせず、スパarsなマルチビューRGB動画から高精細でマルチプレイヤーのパフォーマンスキャプチャを実現する新規手法を提示する。空間的アテンションに配慮したモジュール、SMPLに基づく3次元事前知識、および時間的統合戦略を組み合わせることで、重度の隠蔽と時間的不一致が生じる状況下でも最先端の再構成性能を達成した。その有効性は、新規の高品質データセットMultiHumanを用いて検証された。

ABSTRACT

We propose DeepMultiCap, a novel method for multi-person performance capture using sparse multi-view cameras. Our method can capture time varying surface details without the need of using pre-scanned template models. To tackle with the serious occlusion challenge for close interacting scenes, we combine a recently proposed pixel-aligned implicit function with parametric model for robust reconstruction of the invisible surface areas. An effective attention-aware module is designed to obtain the fine-grained geometry details from multi-view images, where high-fidelity results can be generated. In addition to the spatial attention method, for video inputs, we further propose a novel temporal fusion method to alleviate the noise and temporal inconsistencies for moving character reconstruction. For quantitative evaluation, we contribute a high quality multi-person dataset, MultiHuman, which consists of 150 static scenes with different levels of occlusions and ground truth 3D human models. Experimental results demonstrate the state-of-the-art performance of our method and the well generalization to real multiview video data, which outperforms the prior works by a large margin.

研究の動機と目的

  • 事前スキャン済みテンプレートを必要とせず、スパarsなマルチビューRGB動画から高精細でマルチプレイヤーの3次元パフォーマンスキャプチャを可能にすること。
  • パラメトリックなSMPLモデルを3次元ジオメトリの代理として用いるimplicit関数と組み合わせることで、密に接触するシーンにおける重度の隠蔽を緩和すること。
  • マルチビュー特徴統合に向けた空間的アテンションに配慮したモジュールを導入することで、微細な幾何的ディテールの回復を向上させること。
  • 新しいSDFベースの時間的統合手法を用いて、動的シーケンスにおける時間的整合性を向上させること。
  • 150シーンのマルチプレイヤー、インタラクティブなシーンを含み、隠蔽度が変動する高品質なベンチマークデータセットMultiHumanを提供すること。

提案手法

  • 空間的アテンションに配慮したモジュールを設計し、複数視点からの特徴を適応的に統合することで、異なる視点から得られる高周波数の幾何的ディテールに注目する。
  • SMPLを3次元事前知識として統合し、隠蔽領域における完全な人体再構成を可能にした。グローバルな法線マップを用いてアテンションをガイドすることで、耐障害性を向上させた。
  • 時間的統合戦略として、動画フレーム間の符号付き距離関数(SDF)を重み付けすることで、ノイズ低減と動的再構成における時間的整合性の向上を実現した。
  • ピクセルアライメントされたimplicit関数を用いて3次元ジオメトリを表現することで、マルチビュー画像から効率的かつ詳細な表面再構成を可能にした。
  • 本システムは、150の高品質でマルチプレイヤー、インタラクティブなシーンを含み、隠蔽度が変動する新しいデータセットMultiHumanを用いて訓練および評価された。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの手法は、事前スキャン済みテンプレートを必要とせず、スパarsなマルチビューRGB動画から複数人の相互作用する人物の高精細3次元再構成を達成できるか?
  • RQ23次元事前知識とアテンションメカニズムを組み合わせることで、マルチプレイヤーのパフォーマンスキャプチャにおける重度の隠蔽をどのように緩和できるか?
  • RQ3空間的アテンションモジュールは、マルチビュー3次元再構成における微細な幾何的ディテール回復をどの程度向上させられるか?
  • RQ4時間的統合戦略は、動的3次元シーケンスにおけるノイズと時間的不整合をどの程度低減できるか?
  • RQ5複数人で構成され、隠蔽が生じるシーンを含む新規の高品質データセットは、パフォーマンスキャプチャシステムの評価に信頼できるベンチマークとして機能できるか?

主な発見

  • DeepMultiCapは、合成データおよび実世界データの両方において、先行研究を大きく上回る最先端のパフォーマンスを達成した。
  • 空間的アテンションに配慮したモジュールは、特に法線マップのような高周波数ディテールを含む状況で再構成品質を顕著に向上させた。
  • SMPLを3次元プロキシとして統合することで、隠蔽された身体部位の再構成が安定した。アブレーションスタディでは、SMPL事前知識を削除した場合に顕著な精度低下が確認された。
  • 時間的統合手法により、時間的アーティファクトが低減され、動的シーケンスにおける整合性が向上した。定性的な比較および補足動画でもその有効性が示された。
  • 150の高品質でマルチプレイヤー、インタラクティブなシーンを含み、隠蔽度が変動するMultiHumanデータセットは、マルチプレイヤーのパフォーマンスキャプチャシステムの詳細かつ信頼性の高い評価を可能にした。
  • 本手法は、実世界のマルチビュー動画データに対しても強く一般化でき、極めて厳しい隠蔽条件下でも高精細な結果を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。