Skip to main content
QUICK REVIEW

[論文レビュー] Deep Fashion3D: A Dataset and Benchmark for 3D Garment Reconstruction from Single Images

Heming Zhu, Yu Cao|arXiv (Cornell University)|Mar 28, 2020
3D Shape Modeling and Analysis参考文献 68被引用数 14
ひとこと要約

この論文では、2078体の実世界の衣類モデルを含み、10のカテゴリにわたり、3D特徴線、マルチビュー画像、ボディポーズを含む豊富なアノテーションを備えた、これまでで最大の公開可能3D衣類データセットであるDeep Fashion3Dを紹介する。本研究では、メッシュ表現と暗黙的表現を統合する、可変的なテンプレートに基づく新規なネットワークを提案し、1枚の画像から多様な衣類のトポロジーを再構築する。カテゴリ特化型モデルと比較して、一般化性能が著しく向上し、過学習が軽減される。

ABSTRACT

High-fidelity clothing reconstruction is the key to achieving photorealism in a wide range of applications including human digitization, virtual try-on, etc. Recent advances in learning-based approaches have accomplished unprecedented accuracy in recovering unclothed human shape and pose from single images, thanks to the availability of powerful statistical models, e.g. SMPL, learned from a large number of body scans. In contrast, modeling and recovering clothed human and 3D garments remains notoriously difficult, mostly due to the lack of large-scale clothing models available for the research community. We propose to fill this gap by introducing Deep Fashion3D, the largest collection to date of 3D garment models, with the goal of establishing a novel benchmark and dataset for the evaluation of image-based garment reconstruction systems. Deep Fashion3D contains 2078 models reconstructed from real garments, which covers 10 different categories and 563 garment instances. It provides rich annotations including 3D feature lines, 3D body pose and the corresponded multi-view real images. In addition, each garment is randomly posed to enhance the variety of real clothing deformations. To demonstrate the advantage of Deep Fashion3D, we propose a novel baseline approach for single-view garment reconstruction, which leverages the merits of both mesh and implicit representations. A novel adaptable template is proposed to enable the learning of all types of clothing in a single network. Extensive experiments have been conducted on the proposed dataset to verify its significance and usefulness. We will make Deep Fashion3D publicly available upon publication.

研究の動機と目的

  • 衣類再構築における深層学習モデルの学習に向け、大規模かつ高品質な3D衣類データセットの不足に対処すること。
  • 現実的な変形と豊富なアノテーションを備えた包括的なベンチマークを提供することで、1枚の画像からの高精細な3D衣類再構築を可能にすること。
  • カテゴリ特化型モデルの限界を克服し、多様な衣類トポロジーに一般化可能な統一されたネットワークアーキテクチャの開発。
  • 1つのネットワーク内ですべての衣類タイプの学習を可能にする新規な適応可能なテンプレートの導入により、過学習を低減し、一般化性能を向上させること。

提案手法

  • データセットは、マルチビューRGB画像と3D再構築パイプラインを用いて実際の衣類をスキャンすることで構築され、現実的なしわや変形を捉えている。
  • 各衣類は、再構築された点群上で新規なラベル付けプロトコルを用いて、ネックラインやヘムなどの主要な幾何的輪郭である3D特徴線をアノテーションしている。
  • 新規な適応可能なテンプレートを導入し、衣類の種別に応じて意味的領域と特徴線を動的に活性化することで、1つのネットワークが多様なトポロジーを処理可能にしている。
  • メッシュベースと暗黙的表現学習を組み合わせた手法:メッシュヘッドが衣類の形状を予測し、ResNet-18特徴抽出器からの潜在コードを用いて暗黙的ヘッドが表面を回帰している。
  • チャーム距離を用いた特徴線フィッティングとエッジ長の正則化を組み合わせたマルチタスク損失関数により、ジグザグアーチファクトを低減し、滑らかさを向上させている。
  • 訓練では、L_total = L_recon + λ_reg * ||θ||² + L_line + λ_edge * L_edge の組み合わせ損失を使用し、λ_reg = 1e-5 および λ_edge = 0.2 とする。

実験結果

リサーチクエスチョン

  • RQ1カテゴリ特化型のブランンチを必要とせずに、1つのディープラーニングモデルが多様な3D衣類トポロジーに一般化可能か?
  • RQ2固定されたカテゴリ特化型テンプレートと比較して、適応可能なテンプレートは一般化性能の向上と過学習の低減にどの程度効果的か?
  • RQ33D特徴線アノテーションは、1枚画像からの3D衣類再構築の正確性と幾何的妥当性をどの程度向上させるか?
  • RQ4多様で大規模なデータセットで訓練された統一ネットワークは、限定的でサブセット特化のデータで訓練されたモデルを上回る性能を示せるか?

主な発見

  • Deep Fashion3Dデータセットには、10のカテゴリにわたり、563体のユニークなインスタンスからなる2078体の3D衣類モデルが含まれており、MGN(356体)など既存のデータセットと比較して顕著に大規模である。
  • 提案された適応可能なテンプレートにより、全データセットでの訓練が可能となり、カテゴリ特化型モデルと比較して一般化性能が向上し、過学習が軽減された。
  • 高品質な特徴線予測が達成されており、トレーニング中に見られなかったイン・ザ・ワイルドな画像に対しても、真値に非常に近い結果が得られている。
  • 微調整されたResNet-18を用いたOccNetによる暗黙的表面再構築により、マルチビューの監視のおかげで詳細な幾何学的回復が可能となり、精度が向上している。
  • エッジ長の正則化損失(λ_edge = 0.2)により、予測された特徴線におけるジグザグアーチファクトが効果的に低減されつつ、真値の輪郭と整合性を保っている。
  • イン・ザ・ワイルドな画像における定性的な結果から、モデルが多様な衣類スタイルを、正確なトポロジーと幾何的詳細を備えて再構築できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。