Skip to main content
QUICK REVIEW

[論文レビュー] Neural 3D Clothes Retargeting from a Single Image

Jae Shin Yoon, Kihwan Kim|arXiv (Cornell University)|Jan 29, 2021
3D Shape Modeling and Analysis参考文献 68被引用数 5
ひとこと要約

本稿では、大規模な物理的にシミュレートされた合成データを活用して、一括RGB画像から妥当な衣類の変形を学習することにより、3次元衣類のリターゲティングのための半教師付きニューラルフレームワーク、CRNetを提案する。この手法は、接触点とシルエットの一致を用いた自己教師信号により、実画像に適応し、3次元衣類データの教師なしに、写真的にリアルな、物理的に妥当なリターゲティングを実現する。遮蔽や運動ブラーがあっても同様に有効である。

ABSTRACT

In this paper, we present a method of clothes retargeting; generating the potential poses and deformations of a given 3D clothing template model to fit onto a person in a single RGB image. The problem is fundamentally ill-posed as attaining the ground truth data is impossible, i.e., images of people wearing the different 3D clothing template model at exact same pose. We address this challenge by utilizing large-scale synthetic data generated from physical simulation, allowing us to map 2D dense body pose to 3D clothing deformation. With the simulated data, we propose a semi-supervised learning framework that validates the physical plausibility of the 3D deformation by matching with the prescribed body-to-cloth contact points and clothing silhouette to fit onto the unlabeled real images. A new neural clothes retargeting network (CRNet) is designed to integrate the semi-supervised retargeting task in an end-to-end fashion. In our evaluation, we show that our method can predict the realistic 3D pose and deformation field needed for retargeting clothes models in real-world examples.

研究の動機と目的

  • 2次元の衣類変形の教師あり3次元データが入手できないため、一括画像からの3次元衣類リターゲティングの不適切な問題に対処すること。
  • 大規模な物理的にシミュレートされた合成データを用いて、2次元ボディポーズと3次元衣類変形の空間的関係を学習すること。
  • 3次元衣類データのラベルなしで、自己教師信号を用いて事前学習済みの衣類変形モデルを実世界の画像に適応させること。
  • 実画像における任意のボディポーズと外見に、多様な衣類テンプレート(例:Tシャツ、ドレス)を正確にリターゲティングできること。
  • 明示的なトラッキングやスムージングモジュールなしで、オンラインのリファインメントにより動画シーケンスにおける時間的安定性を実現すること。

提案手法

  • 多様なボディポーズで物理シミュレーションを用いて大規模な合成3次元衣類変形データを生成し、2次元から3次元への対応関係のエンドツーエンド学習を可能にする。
  • 半教師付き学習を統合した神経衣類リターゲティングネットワーク(CRNet)を設計し、合成データから実画像への知識移行を実現する。
  • 2つの自己教師信号を用いて物理的妥当性を強制する:(1) ボディと衣類間の接触点の一貫性、(2) 目標画像とのシルエットの一致。
  • 推論中に繰り返し衣類変形とカメラポーズを調整するオンラインリファインメントアルゴリズムを導入し、視覚的リアリズムと時間的安定性を向上させる。
  • 固定トポロジーメッシュをリターゲティングされた衣類に使用することで、再トレーニングなしに新しい衣類へのテクスチャマッピングと外見転送を可能にする。
  • 合成データを通じてSMPLベースのボディプライヤーを暗黙的に活用し、明示的な3次元ボディポーズ推定を回避することで計算コストを低減する。

実験結果

リサーチクエスチョン

  • RQ13次元衣類データの教師なしで、1枚の2次元画像から神経ネットワークが現実的な3次元衣類変形を学習できるか?
  • RQ2物理シミュレーションと自己教師信号をどのように組み合わせることで、3次元衣類テンプレートを実画像にゼロショットで適応可能にするか?
  • RQ3接触点とシルエット一致が、単一画像からの3次元衣類リターゲティングのリアリズムと正確性をどの程度向上できるか?
  • RQ4アーキテクチャの変更を最小限に抑え、多様な衣類テンプレート(例:Tシャツ、ドレス)に一般化可能か?
  • RQ5オンラインリファインメントは、明示的な時間的モデリングなしで、空間的整合性と動画シーケンスにおける時間的安定性の両方を向上させるか?

主な発見

  • 本手法は、複雑なポーズ、遮蔽、運動ブラーを伴う実世界の画像においても、高い品質の3次元衣類リターゲティングを達成し、視覚的リアリズムと幾何学的妥当性を示した。
  • 接触点損失($\mathcal{L}_c$)とシルエット境界損失($\mathcal{L}_d$)の導入により再構成精度が著しく向上し、アブレーションスタディでは $\mathcal{L}_c + \mathcal{L}_d$ が個別の損失よりも優れていることが示された。
  • オンラインリファインメントステップはYouTube動画クリップで時間的安定性スコア1.37を達成し、理論的下限値1に近く、明示的なトラッキングなしで滑らかな動きを実現した。
  • CRNetフレームワークは、出力次元の調整や接触点・意味的境界の再定義により、最小限の変更で新しい衣類テンプレート(例:ワンピースドレス)に成功して一般化した。
  • 本手法は、SMPLベースのボディ再構築に依存するベースライン手法よりも優れており、ボディポーズ推定の誤差伝搬なしに直接衣類変形を学習するため、誤差が蓄積されない。
  • 本手法は、テンプレートとターゲット衣類のトポロジーが異なる場合(例:Tシャツから長袖シャツ)でも、リターゲティングされた衣類にテクスチャマッピングを施し、写真的リアリズムのある3次元バーチャルトライアルを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。