Skip to main content
QUICK REVIEW

[論文レビュー] Ctrl-Room: Controllable Text-to-3D Room Meshes Generation with Layout Constraints

Chuan Fang, Dong, Yuan|arXiv (Cornell University)|Oct 5, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

Ctrl-Room は、自然言語プロンプトから高精細で幾何学的に整合性のある 3D ルームメッシュを生成するためのテキストから 3D メッシュへの変換フレームワークを提案する。レイアウト制約付きの拡散モデルを活用し、シーンコードのノイズ除去ネットワークとマルチビュー拡散ベースの外観生成パイプライン、マスクガイドド編集モジュールを組み合わせることで、最先端の手法と比較して優れた知覚的品質と 3D 構造の完全性を達成する。

ABSTRACT

Text-driven 3D indoor scene generation is useful for gaming, the film industry, and AR/VR applications. However, existing methods cannot faithfully capture the room layout, nor do they allow flexible editing of individual objects in the room. To address these problems, we present Ctrl-Room, which can generate convincing 3D rooms with designer-style layouts and high-fidelity textures from just a text prompt. Moreover, Ctrl-Room enables versatile interactive editing operations such as resizing or moving individual furniture items. Our key insight is to separate the modeling of layouts and appearance. Our proposed method consists of two stages: a Layout Generation Stage and an Appearance Generation Stage. The Layout Generation Stage trains a text-conditional diffusion model to learn the layout distribution with our holistic scene code parameterization. Next, the Appearance Generation Stage employs a fine-tuned ControlNet to produce a vivid panoramic image of the room guided by the 3D scene layout and text prompt. We thus achieve a high-quality 3D room generation with convincing layouts and lively textures. Benefiting from the scene code parameterization, we can easily edit the generated room model through our mask-guided editing module, without expensive edit-specific training. Extensive experiments on the Structured3D dataset demonstrate that our method outperforms existing methods in producing more reasonable, view-consistent, and editable 3D rooms from natural language prompts.

研究の動機と目的

  • 正確なレイアウト制御を備えた制御可能でテキスト条件付きの 3D ルームメッシュ生成を実現すること。
  • 部分的なシーン記述からの幾何学的に整合性があり、視覚的に現実的な 3D ルームを生成する課題に対処すること。
  • レイアウトに配慮した拡散モデリングとパノラマ再構築を統合することで、3D 構造の完全性と知覚的品質を向上させること。
  • マスクガイドドインpaintingと潜在空間最適化パイプラインを用いて、3D ルームメッシュのインタラクティブ編集を支援すること。
  • ユーザーサービュー評価と定量的比較を通じて、2D パノラマ品質と 3D メッシュ忠実度の両面で既存手法を上回るフレームワークを提供すること。

提案手法

  • ノイズの多い部分的なテキストプロンプトから構造的な 3D シーンコードを生成するために、IDDPMに基づくシーンコードノイズ除去ネットワークを用い、1D畳み込み U-Net アーキテクチャとアテンションブロックを用いてグローバルおよび意味的文脈をモデル化する。
  • シーンコードは、壁や家具をノードとして符号化し、クラスラベル、3D 中心座標、サイズ、方向(コサインとサイン表現)を属性として持つ。ノード数を固定するためパディングを適用する。
  • レイアウト条件付きのシーンコードから高精細でループ整合性のある RGB パノラマを生成するためのマルチビュー拡散モデル(MVDiffusion)を用い、100 ステップの DDIM サンプリングと 90° 回転増強を実装する。
  • パノラマ再構築モジュールは、深度推定と表面再構築を用いてマルチビュー画像を統合し、360° 全体のメッシュ生成を可能にする。
  • マスクガイドド編集モジュールは、微調整された Control-Seg モデルを用いて編集領域をインpaintし、潜在変数を最適化することで、テクスチャの一貫性を維持し、インタラクティブなシーン編集を可能にする。
  • テキストからパノラマ生成(Text2Light を介して)、レイアウトモデリング、3D メッシュ再構築を統合した一貫したパイプラインを構築し、エンドツーエンドの制御可能 3D ルーム生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1拡散モデルは、部分的なテキスト記述からレイアウト制約を尊重しながら幾何学的に整合性のある 3D ルームメッシュを生成できるか?
  • RQ2レイアウトに配慮したシーンコードノイズ除去の統合は、無条件生成と比較して、3D 構造の完全性と視覚的忠実度をどの程度向上させるか?
  • RQ3マルチビュー拡散合成は、3D ルーム生成におけるパノラマの一貫性と視覚的品質をどの程度向上させるか?
  • RQ4潜在空間最適化とマスクガイドドインpaintingを用いたインタラクティブ編集は、3D ルームメッシュの編集を効果的に支援できるか?
  • RQ5レイアウト制約とマルチビュー一貫性は、生成された 3D ルームにおける優れた知覚的品質と構造的整合性にどのように寄与するか?

主な発見

  • ユーザースタディーにおいて、Ctrl-Room は知覚的品質(平均 4.3 / 5)と 3D 構造の完全性(平均 4.1 / 5)で、Text2Room や MVDiffusion といったベースラインを著しく上回った。
  • 本手法は、境界の一貫性に欠ける Text2Light や、合理的なレイアウトを回復できない MVDiffusion よりも、より優れたレイアウト整合性と少ないアーティファクトを持つパノラマを生成した。
  • アテンションブロックを備えたシーンコードノイズ除去ネットワークの使用により、部分的なテキストプロンプトからの空間的関係と意味的文脈の効果的なモデル化が可能になった。
  • 90° 回転増強を施したマルチビュー拡散パイプラインは、ループ整合性のあるパノラマを生成し、画像境界における視覚的アーティファクトを低減した。
  • マスクガイドドモジュールによるインタラクティブ編集は、テクスチャの一貫性を効果的に維持し、現実的なシーン変更を可能にした。定性的な結果からもその有効性が示された。
  • 本フレームワークは、ベッドルーム(N=23 ノード)とリビングルーム(N=45 ノード)の両方に対して優れた一般化性能を示し、部屋タイプを問わず一貫した性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。