[論文レビュー] Latent-NeRF for Shape-Guided Generation of 3D Shapes and Textures
本稿では、事前学習済みの自己符号化器の潜在空間で直接動作するように潜在拡散モデル(LDM)を適応させることで、各ステップでのRGBから潜在空間への変換を回避し、テキストおよび形状ガイド付き3D生成を可能にするLatent-NeRFを提案する。Sketch-Shapeガイドランスにより構造的制御を向上させるとともに、Latent-Paintによりメッシュ上のテクスチャ生成を実現し、効率的な潜在空間最適化を用いて高精細で制御可能な3D形状およびテクスチャ合成を達成している。
Text-guided image generation has progressed rapidly in recent years, inspiring major breakthroughs in text-guided shape generation. Recently, it has been shown that using score distillation, one can successfully text-guide a NeRF model to generate a 3D object. We adapt the score distillation to the publicly available, and computationally efficient, Latent Diffusion Models, which apply the entire diffusion process in a compact latent space of a pretrained autoencoder. As NeRFs operate in image space, a naive solution for guiding them with latent score distillation would require encoding to the latent space at each guidance step. Instead, we propose to bring the NeRF to the latent space, resulting in a Latent-NeRF. Analyzing our Latent-NeRF, we show that while Text-to-3D models can generate impressive results, they are inherently unconstrained and may lack the ability to guide or enforce a specific 3D structure. To assist and direct the 3D generation, we propose to guide our Latent-NeRF using a Sketch-Shape: an abstract geometry that defines the coarse structure of the desired object. Then, we present means to integrate such a constraint directly into a Latent-NeRF. This unique combination of text and shape guidance allows for increased control over the generation process. We also show that latent score distillation can be successfully applied directly on 3D meshes. This allows for generating high-quality textures on a given geometry. Our experiments validate the power of our different forms of guidance and the efficiency of using latent rendering. Implementation is available at https://github.com/eladrich/latent-nerf
研究の動機と目的
- テキストガイド付き3D生成における構造的制御の欠如、ならびにしばしば制約のないまたは一貫性のない幾何形状が生じる問題に対処すること。
- スコア分散を潜在拡散モデル(LDM)に適応させることで、NeRFの潜在空間において効率的かつ高品質な3D形状およびテクスチャ生成を実現すること。
- ユーザーが粗い3D幾何形状を構造的事前分布として定義できるようにするSketch-Shapeガイドランスを導入すること。
- レンダリングされたメッシュを通じて潜在空間に表現されたテクスチャマップに、拡散モデルの勾配を直接バックプロパゲートすることで、明示的な3Dメッシュ上でのテクスチャ生成を可能にすること。
- 潜在空間でのレンダリングおよびガイドランスがピクセル空間ベースラインを上回る品質および効率性を示すことを実証すること。
提案手法
- 事前学習済みの自己符号化器の潜在空間で直接訓練および最適化されるNeRFモデル、Latent-NeRFを提案し、各ステップでのRGBから潜在空間への変換を排除する。
- 2D LDMからのスコア分散を、潜在空間におけるNeRF最適化をガイドするように適応させ、高効率かつ高品質なテキストから3Dへの生成を実現する。
- 最適化中に粗い3D形状を構造的事前分布として使用するソフトオブネシー制約を適用することで、Sketch-Shapeガイドランスを導入する。
- テクスチャマップを潜在空間に表現し、レンダリングされたメッシュを通じて拡散モデル勾配を直接テクスチャマップにバックプロパゲートすることで、Latent-Paintを実現する。
- 近似的な潜在空間からRGBへのマッピングを初期化として使用する学習可能な線形層を用いて、学習済みのLatent-NeRFをRGB NeRFに変換可能にする。
- 必要に応じてXAtlasを用いて自動UVパラメータ化を実施し、UVマップおよび面ごとの潜在テクスチャ最適化の両方をサポートする。
実験結果
リサーチクエスチョン
- RQ12D潜在拡散モデルからのスコア分散を、潜在空間におけるNeRFベースの3D生成に効果的に適応できるか?
- RQ2Sketch-Shapeガイドランスは、テキストから3Dへの生成における構造的整合性および制御性をどのように向上させるか?
- RQ3潜在空間におけるテクスチャ生成(Latent-Paint)は、拡散モデルのガイドランスを用いて、明示的な3Dメッシュ上に高品質で詳細なテクスチャを生成できるか?
- RQ4ピクセル空間最適化と比較して、潜在空間で動作させることで著しく効率性および品質が向上するか?
- RQ5テキストと形状のガイドランスを組み合わせることで、より整合的かつ意味的に整合性のある3D形状をどれほど効果的に生成できるか?
主な発見
- Latent-NeRFは、繰り返し潜在空間への変換を回避することで、計算コストを削減しつつ性能を維持し、効率的かつ高品質な3D生成を実現する。
- Sketch-Shapeガイドランスにより、ユーザーが粗い幾何形状を定義可能であり、ソフト制約強度(σS)を変更することで、厳密な適合から自由形式の進化まで制御可能である。
- σS = 0.05の場合、生成された形状は条件付きのSketch-Shapeと密接に一致する。σSを1.5に増加させると、顕著な幾何的逸脱が生じ、調整可能な柔軟性が示された。
- Latent-Paintは、Tango や CLIPMesh といった先行手法と比較して、UVマップの有無に関わらず、複雑な形状に対してもより正確で詳細なテクスチャを生成できる。
- 本手法は、複数のプロンプトおよび入力幾何形状、特にレオパード柄のフィッシュのような複雑なメッシュを含む、多様で高精細な3D形状およびテクスチャの生成に成功している。
- 本手法は、Latent-NeRFからRGB NeRFへの変換をサポートしており、シェーディングや追加のRGB拡散ガイドランスによるさらなる最適化が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。