Skip to main content
QUICK REVIEW

[論文レビュー] gDNA: Towards Generative Detailed Neural Avatars

Xu Chen, Tianjian Jiang|arXiv (Cornell University)|Jan 11, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

gDNAは、1〜3枚のポーズ付きスキャンから、多様で詳細な3D衣装付き人間アバターを生成する生成的ニューラルアバターモデルを提案する。リアルな確率的シワと明示的なポーズ制御を実現し、スキャンの再現性も高く、生成の忠実度と3Dスキャンへのフィッティングで最先端の性能を達成する。マルチサブジェクトのフォワードスキンニングと、レンダリング済み法線マップにおける2D adversarial訓練で強化された3D法線フィールドを組み合わせることで実現した。

ABSTRACT

To make 3D human avatars widely available, we must be able to generate a variety of 3D virtual humans with varied identities and shapes in arbitrary poses. This task is challenging due to the diversity of clothed body shapes, their complex articulations, and the resulting rich, yet stochastic geometric detail in clothing. Hence, current methods to represent 3D people do not provide a full generative model of people in clothing. In this paper, we propose a novel method that learns to generate detailed 3D shapes of people in a variety of garments with corresponding skinning weights. Specifically, we devise a multi-subject forward skinning module that is learned from only a few posed, un-rigged scans per subject. To capture the stochastic nature of high-frequency details in garments, we leverage an adversarial loss formulation that encourages the model to capture the underlying statistics. We provide empirical evidence that this leads to realistic generation of local details such as wrinkles. We show that our model is able to generate natural human avatars wearing diverse and detailed clothing. Furthermore, we show that our method can be used on the task of fitting human models to raw scans, outperforming the previous state-of-the-art.

研究の動機と目的

  • ポーズ制御を備えた多様で詳細な3D衣装付き人間アバターの生成を可能とし、シワのような高周波数の表面詳細をリアルに再現すること。
  • コア形状や表面登録、手動で定義されたスキンニングウェイトを必要としない、未加工でリグのない3Dスキャンから生成モデルを学習すること。
  • 一貫した暗黙的表現において、アイデンティティ、形状、関節可動性、衣装変形を分離し、忠実度と一般化性能を向上させること。
  • 新規アバターの生成と、実スキャンへの高忠実度のフィッティングを両方可能とし、既存のSOTA手法を上回ること。

提案手法

  • コア形状と高周波数の法線詳細を分離するキャノニカル空間における暗黙的表現を用い、ポーズおよびサイズの一般化を可能にする。
  • 1〜3枚のポーズ付きスキャンから、明示的教師信号なしに、共通の潜在空間内で形状とスキンニングウェイトを学習するマルチサブジェクトフォワードスキンニングモジュールを訓練する。
  • 学習されたワープフィールドにより、同じスキンニングフィールドを用いて異なるボディサイズの間で正確な変形を実現し、未学習のボディ形状への一般化を向上させる。
  • 高周波数の詳細(例:シワ)は、粗い特徴に条件付けられた3D法線フィールドでモデル化し、暗黙的表面レンダラによって生成された2D法線マップを用いた敵対的訓練を適用する。
  • レンダラを介して3D-2D対応関係を確立し、敵対的損失を3D法線フィールドにバックプロパゲートすることで、UV空間手法の制限を克服する。
  • 3D再構成損失と敵対的損失の組み合わせでモデルを訓練し、後者は特に衣装のリアルな幾何的詳細に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、手動の教師信号なしに、1〜3枚のポーズ付きスキャンから、多様で詳細な3D衣装付き人間アバターを学習して生成できるか?
  • RQ2シワのような確率的で高周波数の幾何的詳細は、衣装付き人の暗黙的ニューラル表現において、どのように効果的にモデル化され、生成されるか?
  • RQ31つの統合モデルが、アイデンティティ、形状、関節可動性、衣装変形を同時に学習し、専用または単一サブジェクト手法を上回る性能を発揮できるか?
  • RQ4このようなモデルは、生成時に未学習のアイデンティティやポーズにどの程度一般化できるか?
  • RQ5同じ生成モデルを、実スキャンへのフィッティングに効果的に応用でき、既存のSOTA手法を上回る精度を達成できるか?

主な発見

  • gDNAはFréchet Identity Distance (FID) 11.54を達成し、Pose ONet (43.80) や詳細法線(敵対的なし)(42.18) といったベースラインを著しく上回り、優れた生成忠実度を示した。
  • 知覚的評価では、参加者の78.7%が実スキャンをベースラインすべてよりも好んだ一方、21.3%の生成サンプルが実スキャンよりもよりリアルであると判断された。
  • 3DスキャンへのフィッティングにおいてもSOTA手法を上回り、SIZERデータセットでPred-to-Scan誤差0.0134、Scan-to-Pred誤差0.0123を達成し、SMPLicit や NPMs を上回った。
  • アブレーションスタディにより、敵対的訓練が不可欠であることが確認された。敵対的訓練なしでは、生成形状が過度に滑らかまたは不規則になり、高周波数の詳細が失われる。
  • gDNAは、学習時に見られなかった新しいアイデンティティにも一般化でき、学習済みスキンニングウェイトを用いてフィッティング済み形状を新しいポーズに再アニメーション可能である。
  • 本手法は、シワのような複雑な衣装の詳細を高忠実度で再構成でき、ユーザーの評価では21.3%のケースで生成サンプルが実スキャンよりもリアルであると感じられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。