[論文レビュー] HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting
HumanGaussian は、構造に配慮したスコア分散抽出(SDS)と段階的負のプロンプトガイド付き手法を用いた 3D ガウススプラッタリング(3DGS)を活用したテキストから 3D ヒューマンを生成するフレームワークを提案する。SMPL-X メッシュ上にガウス関数を初期化し、RGB と深度の二重ブランチ SDS を活用することで、リアルな外観と詳細な幾何構造を有する高精細な 3D ヒューマンを実現。従来手法に比べて品質と効率性に優れ、低分類器フリー・ガイドランス(CFG)スケールでも過剰な彩度化を回避する。
Realistic 3D human generation from text prompts is a desirable yet challenging task. Existing methods optimize 3D representations like mesh or neural fields via score distillation sampling (SDS), which suffers from inadequate fine details or excessive training time. In this paper, we propose an efficient yet effective framework, HumanGaussian, that generates high-quality 3D humans with fine-grained geometry and realistic appearance. Our key insight is that 3D Gaussian Splatting is an efficient renderer with periodic Gaussian shrinkage or growing, where such adaptive density control can be naturally guided by intrinsic human structures. Specifically, 1) we first propose a Structure-Aware SDS that simultaneously optimizes human appearance and geometry. The multi-modal score function from both RGB and depth space is leveraged to distill the Gaussian densification and pruning process. 2) Moreover, we devise an Annealed Negative Prompt Guidance by decomposing SDS into a noisier generative score and a cleaner classifier score, which well addresses the over-saturation issue. The floating artifacts are further eliminated based on Gaussian size in a prune-only phase to enhance generation smoothness. Extensive experiments demonstrate the superior efficiency and competitive quality of our framework, rendering vivid 3D humans under diverse scenarios. Project Page: https://alvinliu0.github.io/projects/HumanGaussian
研究の動機と目的
- テキストプロンプトからの高精細な 3D ヒューマンの生成、特に詳細な幾何構造とリアルな外観を実現する課題に取り組む。
- メッシュやニューラルフィールドに基づく従来の 3D 生成手法に見られる、細部の捉えにくさや高コストな学習の問題を克服する。
- 従来は再構成に用いられていた 3D ガウススプラッタリングを、最適化の安定性と構造的忠実性を向上させたテキスト駆動型 3D 生成フレームワークに適応する。
- 拡散ベースの 3D 生成における過剰な彩度化や浮遊アーティファクトを、段階的負のプロンプトガイド付き手法とサイズに依存したプルーニングにより軽減する。
- マルチビューの監視や複雑な最適化パイプラインを一切必要とせず、テキストプロンプトのみで効率的かつ制御可能な 3D ヒューマン生成を実現する。
提案手法
- 構造に配慮した SDS は、SMPL-X メッシュ上にガウス関数を初期化し、RGB と深度の両空間からのマルチモーダルスコア関数を用いて外観と幾何構造を同時に最適化する。
- 二重ブランチ SDS は、事前学習済みの Stable Diffusion モデルを拡張し、RGB と深度画像を同時にノイズ除去することで、最適化中におけるテクスチャと構造的ガイドラインを統合的に提供する。
- 段階的負のプロンプトガイド付き手法は、SDS 損失をよりノイズの多い生成スコアと、より綺麗な分類器スコアに分解し、訓練中に後者を段階的に減少させることで、低 CFG スケール(例:7.5)における過剰な彩度化を回避する。
- サイズに依存したガウスプルーニングは、別途プルーニング専用フェーズで実施され、サイズ閾値未満のガウス関数を削除することで、微小で浮遊するアーティファクトを効果的に除去する。
- このフレームワークは、3DGS の効率的なラスタライゼーションと適応的密度制御を活用し、密度増強とプルーニングが、内在的な人間の身体的構造とマルチビュー整合性に基づいて制御される。
- この手法は、SMPL-X とスケルトンポーズといった人間の事前知識を、SDS 最適化プロセスに直接統合することで、幾何的整合性を向上させ、アーティファクトを低減する。

実験結果
リサーチクエスチョン
- RQ13D ガウススプラッタリングは、高精度な幾何構造と外観忠実度を実現するテキスト駆動型 3D ヒューマン生成に効果的に適応可能か?
- RQ2SMPL-X やポーズガイドラインといった構造的事前知識は、3DGS ベースの生成における最適化の安定性と細部の捉え込みをどのように向上させるか?
- RQ3段階的負のプロンプトガイド付き手法は、低分類器フリー・ガイドランス(CFG)スケールにおける過剰な彩度化を軽減し、リアルな外観を向上させられるか?
- RQ4二重ブランチ(RGB + 深度)SDS は、単一ブランチの監視に比べて、幾何的整合性とテクスチャのリアルさをどのように向上させるか?
- RQ5サイズに依存したプルーニングは、3DGS ベースの 3D 生成における浮遊アーティファクトをどの程度効果的に除去できるか?
主な発見
- HumanGaussian は 17 名のユーザーァバリュエーターによる評価で、テクスチャ品質の平均意見スコア(MOS)が 4.24、幾何的品質が 3.88、テキスト整合性が 4.71 と、従来手法を大きく上回る。
- 段階的負のプロンプトガイド付き手法を用いることで過剰な彩度化の問題を軽減し、従来は 100 のような大きな値を必要としていた CFG スケール 7.5 でも高品質な結果を達成可能となった。
- サイズに依存したプルーニングは、人体表面付近の浮遊アーティファクトを効果的に除去し、最終的な 3D 出力の視覚的滑らかさとリアルさを向上させた。
- 二重ブランチ SDS(RGB + 深度)は、特に腕や髪の毛のような困難な領域において、単一ブランチの監視に比べて優れた幾何的正則化を実現した。
- SMPL-X を初期化事前知識として統合することで、ベースラインの 3DGS 生成で見られる「マルチフェース・ジャヌス問題」の低減が顕著に見られ、構造的整合性が著しく向上した。
- HumanGaussian は、マルチビューまたは形状事前知識を追加したベースラインでさえも上回る、優れた効率性と品質を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。