Skip to main content
QUICK REVIEW

[論文レビュー] Progressive3D: Progressively Local Editing for Text-to-3D Content Creation with Complex Semantic Prompts

Xinhua Cheng, Tianyu Yang|arXiv (Cornell University)|Oct 18, 2023
Computer Graphics and Visualization Techniques被引用数 4
ひとこと要約

Progressive3Dは、複雑な意味的プロンプト下での正確なテキストから3Dへの生成を実現する一般化されたフレームワークを提案する。生成プロセスを局所的で段階的な編集ステップに分解することで、領域誘導制約と重複する意味的コンポonent抑制(OSCS)を用い、意味的整合性を向上させ、複数の3D表現において複雑なプロンプトに対して最先端の性能を達成した。ベースライン手法よりも83.2%のユーザー選好を獲得した。

ABSTRACT

Recent text-to-3D generation methods achieve impressive 3D content creation capacity thanks to the advances in image diffusion models and optimizing strategies. However, current methods struggle to generate correct 3D content for a complex prompt in semantics, i.e., a prompt describing multiple interacted objects binding with different attributes. In this work, we propose a general framework named Progressive3D, which decomposes the entire generation into a series of locally progressive editing steps to create precise 3D content for complex prompts, and we constrain the content change to only occur in regions determined by user-defined region prompts in each editing step. Furthermore, we propose an overlapped semantic component suppression technique to encourage the optimization process to focus more on the semantic differences between prompts. Extensive experiments demonstrate that the proposed Progressive3D framework generates precise 3D content for prompts with complex semantics and is general for various text-to-3D methods driven by different 3D representations.

研究の動機と目的

  • 複雑で相互に関連する属性を持つ複数のオブジェクトを含むテキストプロンプトにおいて、正確な3Dコンテンツを生成する課題に対処すること。
  • 既存のテキストから3Dへの生成手法が、複雑な意味的文脈下でオブジェクトの欠落、属性の不一致、品質の低下を抱えるという限界を克服すること。
  • 多様な3Dニューラル表現および最適化戦略と互換性を持つ汎用的なフレームワークを開発すること。
  • 段階的で局所的な編集を通じて、生成された3Dコンテンツと複雑なプロンプトとの間の意味的整合性を向上させること。

提案手法

  • ユーザーが定義した領域プロンプトに従って、複雑なテキストから3Dへの生成を局所的編集ステップのシーケンスに分解する。
  • 編集領域外のコンテンツを保持するための一貫性制約と、空の空間から幾何学的形状を生成を促進するための初期化制約を適用する。
  • ソースプロンプトとターゲットプロンプトの間の意味的差異を分離・強調するために、重複する意味的コンポonent抑制(OSCS)を導入する。
  • 指定された領域のみを編集するように焦点を当て、他の領域への干渉を最小限に抑える、潜在変動に基づく最適化プロセスを用いる。
  • アテンションマスキングを介して、CLIPベースの埋め込みを用いて意味的差を計算し、最適化プロセスをガイドする。
  • NeRF、SDF、DMTetを含む多様な3D表現をサポートし、既存のテキストから3Dへのモデルと広範な互換性を実現する。

実験結果

リサーチクエスチョン

  • RQ1段階的で局所的な編集は、複雑なプロンプトにおけるテキストから3Dへの生成における意味的整合性を向上させるか?
  • RQ2重複する意味的コンポonent抑制(OSCS)は、複雑なプロンプトにおける共通属性による干渉をどれほど効果的に低減するか?
  • RQ3提案されたフレームワークは、異なる3Dニューラル表現および最適化パイプラインに一般化可能か?
  • RQ4段階的編集は、構造的および属性的一致性を維持する点で、直接微調整を上回る効果を示すか?
  • RQ5一貫性制約、初期化制約、OSCSといった個々の構成要素は、全体の性能にどの程度寄与しているか?

主な発見

  • CSP-100ベンチマークにおいて、Progressive3Dは0.474のB-VQAスコアと0.609のmGPT-CoTスコアを達成し、ベースラインのDreamTime(0.227および0.522)を顕著に上回った。
  • 人間の好みの調査では、83.2%のユーザーがProgressive3Dの生成結果をDreamTimeよりも好んだ。これは、複雑なプロンプトとの強い知覚的整合性を示している。
  • アブレーションスタディの結果、初期化制約とOSCSを併用することで最高の性能が得られ、すべての構成要素を組み合わせた場合に0.474のB-VQAスコアを記録した。
  • 抑制重みを段階的に増加させたOSCSは、意味的差に焦点を絞る効果を示し、オブジェクトの欠落や属性の不一致を低減した。
  • 定性的および定量的分析を通じて、オブジェクトの欠落や属性の不一致といった問題が、フレームワークによって効果的に緩和されていることが検証された。
  • NeRF、SDF、DMTetを含む複数の3D表現において、同フレームワークが一般化可能であることが確認され、広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。