Skip to main content
QUICK REVIEW

[論文レビュー] HumanNorm: Learning Normal Diffusion Model for High-quality and Realistic 3D Human Generation

Xin Huang, Ruizhi Shao|arXiv (Cornell University)|Oct 2, 2023
Human Motion and Animation被引用数 5
ひとこと要約

HumanNormは、高品質な3D人体生成のための2Dテキストから画像への拡散モデルを向上させる、新しいノーマル拡散モデルを提案する。幾何学的形状のためのノーマル適応拡散モデルと、テクスチャのためのノーマル整合拡散モデルを訓練することで、幾何学的正確性と自然な外観を兼ね備えた詳細で現実的な3D人体を生成し、幾何学的品質およびテクスチャ品質の両面で既存手法を上回る性能を発揮する。

ABSTRACT

Recent text-to-3D methods employing diffusion models have made significant advancements in 3D human generation. However, these approaches face challenges due to the limitations of text-to-image diffusion models, which lack an understanding of 3D structures. Consequently, these methods struggle to achieve high-quality human generation, resulting in smooth geometry and cartoon-like appearances. In this paper, we propose HumanNorm, a novel approach for high-quality and realistic 3D human generation. The main idea is to enhance the model's 2D perception of 3D geometry by learning a normal-adapted diffusion model and a normal-aligned diffusion model. The normal-adapted diffusion model can generate high-fidelity normal maps corresponding to user prompts with view-dependent and body-aware text. The normal-aligned diffusion model learns to generate color images aligned with the normal maps, thereby transforming physical geometry details into realistic appearance. Leveraging the proposed normal diffusion model, we devise a progressive geometry generation strategy and a multi-step Score Distillation Sampling (SDS) loss to enhance the performance of 3D human generation. Comprehensive experiments substantiate HumanNorm's ability to generate 3D humans with intricate geometry and realistic appearances. HumanNorm outperforms existing text-to-3D methods in both geometry and texture quality. The project page of HumanNorm is https://humannorm.github.io/.

研究の動機と目的

  • テキストから3Dへの変換に際して、3D構造的認識が欠如しており、滑らかでアニメ調の3D人体を生成する既存のテキストから3Dへの変換手法の限界を是正する。
  • ジャンスアーティファクト、過剰に発色したテクスチャ、しわや髪の毛に偽の3Dディテールが現れる問題を、生成パイプラインに幾何的事前知識を統合することで克服する。
  • 視覚依存的およびボディに配慮したテキストを用いて、マルチビューのノーマルマップ上でトレーニングされたノーマル適応拡散モデルを導入することで、2D拡散モデルの3D幾何学的認識を向上させる。
  • 表面ノーマルに従って外観生成を整列させるノーマル整合拡散モデルを活用し、幾何的ずれや過剰発色を低減することで、テクスチャのリアルさを向上させる。
  • 段階的な幾何学的形状生成戦略とマルチステップスコア蒸留サンプリング(SDS)損失を構築し、トレーニングの安定性と出力品質を向上させる。

提案手法

  • 視覚依存的およびボディに配慮したプロンプトを用いて、3D人体スキャンから得たマルチビューのノーマルマップとトレーニングすることで、高精細で幾何学的認識を持つノーマルマップを生成するノーマル適応拡散モデルを訓練する。
  • ノーマルマップを補完するため、深度情報の提供を目的とした深度適応拡散モデルを導入し、ノーマルが曖昧な領域(例:耳)におけるアーティファクトを低減する。
  • 幾何学的形状生成の段階で、ノーマルマップと深度マップの両方のSDS損失を用いて、3D再構成プロセスをガイドし、正確な幾何的ディテールを確保する。
  • 段階的な幾何学的形状生成戦略を実装し、3Dメッシュを徐々に精錬することで、ノイズを低減し、安定性を向上させる。
  • 予測されたノーマルマップを条件入力として受け取るノーマル整合拡散モデルを訓練し、幾何学的折りたたみや陰影に整合したカラー画像を生成する。
  • テクスチャ生成段階でマルチステップSDS損失を適用し、複数の拡散ステップにわたり画像を回復することで、過剰発色を低減し、リアルさを向上させる。

実験結果

リサーチクエスチョン

  • RQ1ノーマル適応拡散モデルは、テキストから3Dへの変換における2D拡散モデルの3D幾何学的認識を向上させることができるか?
  • RQ2ノーマルマップと深度マップの統合は、ジャンス顔や滑らかな表面といった幾何的アーティファクトを低減するのにどの程度効果的か?
  • RQ3幾何的ディテールに従って外観を整列させるノーマル整合拡散モデルは、テクスチャのリアルさを顕著に向上させることができるか?
  • RQ4マルチステップSDS損失は、単一ステップSDSに比べて過剰発色を低減し、テクスチャの自然さを向上させるか?
  • RQ5段階的な幾何学的形状生成戦略は、3D人体生成の安定性と品質をどの程度向上させるか?

主な発見

  • HumanNormは、顔面や衣装の詳細な幾何学的ディテールを有する、顕著に向上した幾何学的品質の3D人体を生成し、ジャンスアーティファクトを排除する。
  • ノーマル適応拡散モデルは、視覚依存的およびボディに配慮したプロンプトから高精細なノーマルマップを効果的に生成し、正確な3D幾何学的再構成を可能にする。
  • 深度適応拡散モデルは、幾何学的に曖昧な領域(例:耳)におけるアーティファクトを低減する。アブレーションスタディでは、深度SDS損失が幾何学的品質の向上に寄与していることが示された。
  • ノーマル整合拡散モデルは、幾何学的折りたたみに沿ったシャープでリアルなテクスチャを生成し、外観の忠実度において標準的なテキストから画像への拡散モデルを上回る。
  • マルチステップSDS損失は過剰発色を効果的に低減し、単一ステップSDSに比べて、生成されたテクスチャの色と照明の自然さが向上している。
  • HumanNormは、CLIPスコアとユーザースタディの両面で優れた結果を達成しており、テキストプロンプトとの整合性が高く、生成された3D人体の実態感が顕著に向上していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。