Skip to main content
QUICK REVIEW

[論文レビュー] MonoClothCap: Towards Temporally Coherent Clothing Capture from Monocular RGB Video

Donglai Xiang, Fabián Prada|arXiv (Cornell University)|Sep 22, 2020
3D Shape Modeling and Analysis参考文献 63被引用数 4
ひとこと要約

本稿では、事前スキャンされたテンプレートを必要とせずに、モノクロムRGB動画から時間的に整合性のある3D衣装キャプチャを実現する最初の手法、MonoClothCapを提案する。Tシャツ、ショートパンツ、パンツの統計的変形モデルを用い、レンダリングの微分可能化を組み合わせることで、シルエット、セグメンテーション、テクスチャ、法線マップを監視として、衣装の形状を適合させる。これにより、野生の動画からも高精細で時間的に安定した再構成が可能となり、細かいしわのディテールを再現する。

ABSTRACT

We present a method to capture temporally coherent dynamic clothing deformation from a monocular RGB video input. In contrast to the existing literature, our method does not require a pre-scanned personalized mesh template, and thus can be applied to in-the-wild videos. To constrain the output to a valid deformation space, we build statistical deformation models for three types of clothing: T-shirt, short pants and long pants. A differentiable renderer is utilized to align our captured shapes to the input frames by minimizing the difference in both silhouette, segmentation, and texture. We develop a UV texture growing method which expands the visible texture region of the clothing sequentially in order to minimize drift in deformation tracking. We also extract fine-grained wrinkle detail from the input videos by fitting the clothed surface to the normal maps estimated by a convolutional neural network. Our method produces temporally coherent reconstruction of body and clothing from monocular video. We demonstrate successful clothing capture results from a variety of challenging videos. Extensive quantitative experiments demonstrate the effectiveness of our method on metrics including body pose error and surface reconstruction error of the clothing.

研究の動機と目的

  • 事前スキャンされた個人化されたメッシュテンプレートに依存せずに、モノクロムRGB動画から時間的に整合性のある動的衣装変形をキャプチャする課題に対処すること。
  • マルチビューの制御されたスキャンが利用できない野生の動画からも、頑健な衣装キャプチャを可能にすること。
  • 微分可能レンダリングを用いて、シルエット、セグメンテーション、テクスチャ、法線などの複数の画像測定値を統合することで、再構成の時間的整合性と幾何的忠実度を向上させること。
  • Tシャツ、ショートパンツ、パンツなどの一般的な衣類タイプに特化した統計的形状事前分布を用いて、再構成の安定性を向上させること。
  • 畳み込みニューラルネットワークによって推定された法線マップに合わせて、衣装表面をフィッティングすることで、細かいしわのディテールを抽出すること。

提案手法

  • 本手法は、実世界の衣類データに基づいて学習された3つの衣類タイプ(Tシャツ、ショートパンツ、ロングパンツ)の統計的変形モデルを構築し、形状事前分布として用いる。
  • 微分可能レンダラーを用いて、レンダリング画像と入力フレームとの間の光度および幾何的損失を最小化する。シルエット、セマンティックセグメンテーション、テクスチャ、表面法線マップを監視として用いる。
  • 時間経過に伴う変形トラッキングのずれを低減するために、UVテクスチャの拡張戦略を導入し、順次可視テクスチャ領域を拡大する。
  • 畳み込みニューラルネットワークによって予測された法線マップに合わせて、衣装表面をフィッティングすることで、細かいしわのディテールを捉える。
  • ボディポーズは、2Dジョイント、密な対応関係、シルエットなどのマルチモodalな画像の手がかりを用いて初期化し、時間的整合性を確保するために逐次トラッキングとバッチ最適化を実行する。
  • エンドツーエンド最適化と微分可能レンダリング損失を統合することで、ボディポーズ、衣装形状、テクスチャを同時に最適化するパイプラインを構築する。

実験結果

リサーチクエスチョン

  • RQ1事前スキャンされたテンプレートがなくても、モノクロムRGB動画から時間的に整合性のある3D衣装再構成を達成できるか?
  • RQ2統計的衣類変形モデルは、単一視点3D衣装キャプチャにおける再構成の安定性と時間的整合性をどのように向上させるか?
  • RQ3複数の画像測定値(シルエット、セグメンテーション、テクスチャ、法線)の微分可能レンダリングは、幾何的正確性と視覚的忠実度をどの程度向上させるか?
  • RQ4法線マップの監視と表面フィッティングを用いて、モノクロム動画から細かいしわのディテールを効果的に捉えることができるか?
  • RQ5野生の動画において、本手法は単一画像の深層学習手法とテンプレートベース手法に比べて、どの程度頑健性と正確性に優れているか?

主な発見

  • バッチ最適化後、BUFFデータセットのフロント左ビューにおいて、平均点対表面再構成誤差が24.7 mmに低下し、ボディのみのベースライン(29.2 mm)を顕著に下回った。
  • しわ抽出を追加すると、フロント左ビューでの誤差はわずかに24.9 mmに増加したが、幾何的正確性に悪影響を及げず、視覚的リアリズムの向上を示した。
  • 全ビュー(フロント、フロント左、左)において再構成誤差が低減され、視点変動に頑健で、一貫した性能を示した。
  • 時間的スムージングとバッチ最適化により、視覚的品質と時間的整合性が向上したが、定量的誤差にはほとんど影響がなかったため、安定したトラッキングが実現したと示唆された。
  • 定性的な結果から、ボクセル、深度マップ、または暗黙関数を用いた単一画像回帰手法と比較して、本手法は優れた時間的頑健性と一貫した3D対応関係を示した。
  • 本手法は、テンプレートデータを必要とせず、多様な野生の動画からも、複雑なしわや変形を含むリアルな衣類のダイナミクスを成功裏に捉えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。