Skip to main content
QUICK REVIEW

[論文レビュー] 3D Virtual Garment Modeling from RGB Images

Yi Xu, Shanglin Yang|arXiv (Cornell University)|Jul 31, 2019
3D Shape Modeling and Analysis参考文献 40被引用数 4
ひとこと要約

本論文では、特別なハードウェアや人間のモデルを必要とせず、前面と背面のRGB画像2枚のみから3Dテクスチャ付きのバーチャル衣装モデルを生成する新規な手法を提示する。JFNetと呼ばれるマルチタスクディープラーニングネットワークを用いて、ファッションランドマークとセマンティックパーツセグメンテーションを予測し、それらがテンプレートメッシュの変形とテクスチャマッピングをガイドすることで、eコマースの写真からも正確でスケーラブルな3D衣装モデリングを実現する。

ABSTRACT

We present a novel approach that constructs 3D virtual garment models from photos. Unlike previous methods that require photos of a garment on a human model or a mannequin, our approach can work with various states of the garment: on a model, on a mannequin, or on a flat surface. To construct a complete 3D virtual model, our approach only requires two images as input, one front view and one back view. We first apply a multi-task learning network called JFNet that jointly predicts fashion landmarks and parses a garment image into semantic parts. The predicted landmarks are used for estimating sizing information of the garment. Then, a template garment mesh is deformed based on the sizing information to generate the final 3D model. The semantic parts are utilized for extracting color textures from input images. The results of our approach can be used in various Virtual Reality and Mixed Reality applications.

研究の動機と目的

  • eコマースサイトの製品写真のように、入手可能な画像から3Dバーチャル衣装モデリングを可能にすること。
  • ファッションやVR/ARアプリケーションにおける従来の3D衣装モデリングの高コストと複雑さに対処すること。
  • モデル、マネキン、または平らな表面に置かれた状態の衣装を問わず、2枚の入力画像のみで動作する手法を開発すること。
  • セマンティック解析とサイズ推定を活用することで、バーチャルトライオンやデジタルファッションなどのアプリケーション向けに、スケーラブルで低コストな3D衣装モデリングを実現すること。

提案手法

  • ファッションランドマークと衣装画像におけるセマンティックパーツセグメンテーションを同時に予測できるマルチタスク学習ネットワーク、JFNetを訓練する。
  • ランドマークの予測結果を用いて、袖丈や胸幅などの主要な衣装寸法を推定し、それらを3Dテンプレートメッシュの変形に活用する。
  • セマンティックパーツセグメンテーションにより、2D画像のパーツを2Dリファレンステクスチャにマッピングすることで、正確なテクスチャ抽出が可能になる。
  • 推定されたサイズ情報に基づいて3Dテンプレートメッシュを変形させ、入力衣装の比率に一致させる。
  • セグメンテーションされたパーツからテクスチャを抽出し、変形された3Dメッシュに投影することで、完全にテクスチャマップされた3D衣装モデルを生成する。
  • 対称性を仮定することで、単一の画像入力に対しても対応可能となり、最小限の入力で利用性が向上する。

実験結果

リサーチクエスチョン

  • RQ1モデル、マネキン、または平らな状態にある衣装を含め、さまざまな状態の衣装に対して、RGB画像2枚のみから正確に3Dバーチャル衣装を再構築できるか?
  • RQ21つのディープラーニングモデルが、衣装画像に対してファッションランドマークとセマンティックパーツセグメンテーションの両方を効果的に予測できるか?
  • RQ32D画像上のランドマークから推定されたサイズ情報が、3Dテンプレートメッシュを現実的なかたちに変形させるのにどの程度正確に機能するか?
  • RQ4セグメンテーションされたパーツからのテクスチャ抽出が、最終的な3Dモデルにおいて視覚的に妥当で一貫性のある結果を生み出すか?
  • RQ5再トレーニングを必要とせずに、Tシャツやパンツなどのさまざまな衣料タイプや、フィット感や長さなどのスタイルの違いに対しても、どの程度一般化できるか?

主な発見

  • 提案されたJFNetは、トップスでは0.725、パンツでは0.968のmIOU(平均交差率)を達成し、DeepLabV3+などのベースライン手法を上回った。
  • トップスではランドマーク予測の平均誤差(NE)が0.031、パンツでは0.022であり、キーポointの局所化に高い正確性を示した。
  • 3Dモデリングの結果として、袖幅、長さ、フィット感といった入力画像の特徴を反映した視覚的に妥当な衣装が得られ、形状の転送が効果的であることが示された。
  • 本システムは、人体に着用されていなくても、平らな状態やマネキン上での衣装に対しても、2枚の画像から完全な3Dテクスチャ付きモデルを生成できた。
  • 本手法は最小限の歪みでテクスチャマッピングを実現できたが、ソースとターゲットの輪郭が著しく異なる場合には、局所的な変形が生じる場合があった。
  • 対称性の仮定のもとで単一画像入力に対応可能であり、実世界のeコマースの写真セットにおいても柔軟性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。