Skip to main content
QUICK REVIEW

[論文レビュー] SiCloPe: Silhouette-Based Clothed People

Ryota Natsume, Shunsuke Saito|arXiv (Cornell University)|Dec 31, 2018
3D Shape Modeling and Analysis参考文献 60被引用数 7
ひとこと要約

本稿では、1枚の正面画像から完全にテクスチャリングされた3D衣装付き人体を再構築するための深層学習ベースの手法SiCloPeを提案する。2Dの輪郭と3D関節推定値を用いて一貫性のあるマルチビュー輪郭を合成し、グリーディなビュー選択を用いた深層ビジュアルハルアルゴリズムを適用して頑健な3Dジオメトリ再構築を実現する。さらに、画像間変換ネットワークを用いて背面のテクスチャを予測し、マルチビュー手法と同等の結果を達成しているが、入力は単一ビューに限定されている。

ABSTRACT

We introduce a new silhouette-based representation for modeling clothed human bodies using deep generative models. Our method can reconstruct a complete and textured 3D model of a person wearing clothes from a single input picture. Inspired by the visual hull algorithm, our implicit representation uses 2D silhouettes and 3D joints of a body pose to describe the immense shape complexity and variations of clothed people. Given a segmented 2D silhouette of a person and its inferred 3D joints from the input picture, we first synthesize consistent silhouettes from novel view points around the subject. The synthesized silhouettes which are the most consistent with the input segmentation are fed into a deep visual hull algorithm for robust 3D shape prediction. We then infer the texture of the subject's back view using the frontal image and segmentation mask as input to a conditional generative adversarial network. Our experiments demonstrate that our silhouette-based model is an effective representation and the appearance of the back view can be predicted reliably using an image-to-image translation network. While classic methods based on parametric models often fail for single-view images of subjects with challenging clothing, our approach can still produce successful results, which are comparable to those obtained from multi-view input.

研究の動機と目的

  • パrametricなボディモデルや事前キャプチャ済みテンプレートを一切使用せずに、完全に衣装が着たテクスチャリングされた3D人体の単一画像からの再構築を可能にすること。
  • 単一ビュー入力における背面ジオメトリと外観の欠落という課題を克服すること。
  • 衣類の細部を捉え、未観測の被験者にも一般化可能な非パrametricで汎用性の高い手法を開発すること。
  • 最適化されたビュー選択を伴う深層学習強化ビジュアルハル技術を用いて、3D再構築の精度を向上させること。
  • 条件付きGANベースの画像間変換フレームワークを用いて、前面画像から背面のリアルなテクスチャを合成すること。

提案手法

  • 2D入力の輪郭と推定された3D関節ポーズを用いて、3D形状の複雑さを暗黙的表現で符号化する輪郭ベースの暗黙的表現。
  • 入力セグメンテーションと3D関節を用いて、新規の視点から一貫性のある2D輪郭を深層ニューラルネットワークで合成する。
  • 輪郭の一貫性を最大化するように視点を選択するグリーディなビュー選択戦略。
  • 合成された輪郭から深層ビジュアルハルアルゴリズムを用いて3Dメッシュジオメトリを再構築し、衣装付き人体の形状事前分布を組み込む。
  • 条件付き生成対抗ネットワーク(cGAN)が前面画像とセグメンテーションマスクから背面のカラー画像テクスチャを推定する。
  • 2段階パイプラインとして、輪郭合成、最適化されたビュー選択、ディープビジュアルハル、GANベースのテクスチャ転送を統合する手法。

実験結果

リサーチクエスチョン

  • RQ1単一ビューの画像を用いて、高い幾何的忠実度を持つ完全でテクスチャリングされた3D衣装付き人体を再構築できるか?
  • RQ2スパarsな入力からの3D再構築を向上させるために、複数ビュー間の輪郭一貫性をどのように最適化できるか?
  • RQ3合成された輪郭を用いた場合、ディープビジュアルハル手法が従来のビジュアルハル技術を上回れるか?
  • RQ4GANベースの画像間変換ネットワークが、前面画像から背面のリアルなテクスチャをどの程度正確に予測できるか?
  • RQ5本手法は、マルチビュー法および最先端の単一ビュー再構築手法と比較して、正確性と一般化性能の面でどのように差をつけるか?

主な発見

  • グリーディなビュー選択を用いた提案されたディープビジュアルハルアルゴリズムは、ランダムなビュー選択と比較して再構築誤差を69%低減し、単純なビジュアルハル手法を上回る性能を示した。
  • 本手法は、たとえ1枚の入力画像しか与えられていない場合でも、マルチビュービジュアルハル技術と同等の3D再構築品質を達成した。
  • 輪郭合成ネットワークは一貫性のあるマルチビュー輪郭を生成し、とくに凹型領域において3Dジオメトリ予測の精度を顕著に向上させた。
  • GANベースのテクスチャ転送ネットワークは、背面の外観をリアルに推定でき、最終的な3Dモデルの完成度とリアリズムを向上させた。
  • アブレーションスタディの結果、ディープビジュアルハルとグリーディなビュー選択戦略の両方が、再構築アーチファクトの低減と精度向上に不可欠であることが確認された。
  • 本手法は未観測の被験者や複雑な衣装に対しても良好に一般化でき、挑戦的な状況ではパrametricモデルベースの手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。