Skip to main content
QUICK REVIEW

[論文レビュー] A Pixel-Based Framework for Data-Driven Clothing

Ning Jin, Yilin Zhu|arXiv (Cornell University)|Dec 3, 2018
3D Shape Modeling and Analysis参考文献 57被引用数 20
ひとこと要約

本論文は、パターン空間内の2次元RGB画像の系列として3次元の服の変形をモデル化するピクセルベースのディープラーニングフレームワークを提案する。これにより、畳み込みニューラルネットワーク(CNN)がポーズパラメータから現実的な衣類のダイナミクスを学習できる。服の頂点をピクセルとして埋め込み、畳み込みネットワークを用いてテクスチャおよび変位オフセットを予測することで、高精細でスケーラブルな仮想衣料を実現し、スキンニングの不正確さに強く、裸体の正確な形状が不要である。

ABSTRACT

With the aim of creating virtual cloth deformations more similar to real world clothing, we propose a new computational framework that recasts three dimensional cloth deformation as an RGB image in a two dimensional pattern space. Then a three dimensional animation of cloth is equivalent to a sequence of two dimensional RGB images, which in turn are driven/choreographed via animation parameters such as joint angles. This allows us to leverage popular CNNs to learn cloth deformations in image space. The two dimensional cloth pixels are extended into the real world via standard body skinning techniques, after which the RGB values are interpreted as texture offsets and displacement maps. Notably, we illustrate that our approach does not require accurate unclothed body shapes or robust skinning techniques. Additionally, we discuss how standard image based techniques such as image partitioning for higher resolution, GANs for merging partitioned image regions back together, etc., can readily be incorporated into our framework.

研究の動機と目的

  • 正確な裸体形状や複雑な物理シミュレーションが不要な、スケーラブルでデータ駆動型のリアルな仮想衣類フレームワークの開発。
  • パターン空間における2次元RGB画像系列として3次元服を表現することで、畳み込みニューラルネットワークを用いた高精細な服の変形予測の実現。
  • スケルトン変形に依存せず、ポーズ駆動の画像系列から学習することで、キャンディーワラップのねじれなどのスキンニングアーチファクトに対して耐性を高める。
  • 画像ベースのディープラーニング技術を活用し、最小限の計算負荷でリアルタイムな仮想試着アプリケーションを効率的にサポート。
  • 適応的ネットワークアーキテクチャと損失関数を用いて、ネクタイのような高コントラスト・細長い衣類を含む多様な衣類タイプへの一般化を実証。

提案手法

  • 服の幾何を2次元のパターン空間にマップし、各頂点をテクスチャおよび法線座標における身体表面からの変位を符号化するRGB値を持つピクセルとして表現する。
  • 服のピクセルはボディメッシュに重心座標で埋め込まれ、アニメーション中に2次元パターン空間内の位置を維持する。
  • 畳み込みニューラルネットワーク(CNN)を、関節角度パラメータからRGB画像系列を予測するように訓練し、服の変形の「振りつけ」を効果的に学習する。
  • 予測後、RGB値はテクスチャオフセットおよび変位マップとして解釈され、標準的なスキンニング技術を用いて3次元ワールド空間に再投影される。
  • 再構成品質の向上のため、画像分割、領域統合に向けたGAN、およびマルチスケール損失関数(L1、L2、法線、エッジ長さ)といった画像ベースの技術を統合する。
  • ネクタイのような複雑な衣類に対しては、アスペクト比1:4の長方形画像を出力するようにネットワークを適応させ、構造的整合性を保つために専用のエッジ長さ損失を追加する。

実験結果

リサーチクエスチョン

  • RQ13次元服の変形を、パターン空間における2次元RGB画像系列として効果的にモデル化できるか。これにより、強力なCNNによる学習が可能になるか。
  • RQ2裸体形状の不正確さやキャンディーワラップのねじれのようなスキンニングアーチファクトに対して、フレームワークはどの程度耐性を示すか。
  • RQ3ネクタイのような細く高コントラストな衣類を含む多様な衣類タイプに、最小限のアーキテクチャ変更で一般化できるか。
  • RQ4再構成精度と計算効率の最良のトレードオフを達成する損失関数とネットワークアーキテクチャは何か。
  • RQ5GAN や画像分割といった画像ベース技術をフレームワークに統合することで、解像度および視覚的品質をどの程度向上できるか。

主な発見

  • L1損失に法線損失を組み合わせた場合、テストセットにおいて平均頂点位置誤差が0.44 cm、法線ベクトル誤差が0.027コサイン距離を達成した。
  • 法線ベクトル損失(重み0.01)を追加したことで、一般化性能において法線誤差が0.027から0.029に増加したが、これは表面の向きの整合性が向上したことを示している。
  • ネクタイの場合は、216万パラメータのネットワークを用い、出力解像度64×256を達成し、L1損失とエッジ長さ損失(重み0.1)を組み合わせて構造的滑らかさを維持した。
  • ルート関節フレームにおけるPCA埋め込みオフセットを用いた訓練により、一般化誤差が0.67 cmから0.55 cmに低下し、一般化性能が向上した。
  • 全結合層におけるReLU活性化関数は、Tanhと同等の性能を示しながらも、収束が速く、訓練速度と安定性において従来手法を上回った。
  • 本手法は、不正確な裸体形状に対しても耐性を示し、スキンニングアーチファクトが含まれても視覚的品質と低誤差を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。