Skip to main content
QUICK REVIEW

[論文レビュー] InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes

Mohamad Shahbazi, Liesbeth Claessens|arXiv (Cornell University)|Jan 10, 2024
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

InseRF は、明示的な 3D 空間入力を必要とせず、テキストおよび 2D バウンディングボックスを駆動として、ニューラル 3D シーンに 3D 一貫性を持つ生成的オブジェクト挿入を可能にする。2D ディフュージョン編集を用いて単一の参照ビューでオブジェクト生成を固定し、単一ビュー再構築により結果を 3D に持ち上げ、深度誘導配置と NeRF フュージョンにより 3D 一貫性を確保する。局所的で現実的なオブジェクト挿入において、ベースラインを上回る性能を発揮する。

ABSTRACT

We introduce InseRF, a novel method for generative object insertion in the NeRF reconstructions of 3D scenes. Based on a user-provided textual description and a 2D bounding box in a reference viewpoint, InseRF generates new objects in 3D scenes. Recently, methods for 3D scene editing have been profoundly transformed, owing to the use of strong priors of text-to-image diffusion models in 3D generative modeling. Existing methods are mostly effective in editing 3D scenes via style and appearance changes or removing existing objects. Generating new objects, however, remains a challenge for such methods, which we address in this study. Specifically, we propose grounding the 3D object insertion to a 2D object insertion in a reference view of the scene. The 2D edit is then lifted to 3D using a single-view object reconstruction method. The reconstructed object is then inserted into the scene, guided by the priors of monocular depth estimation methods. We evaluate our method on various 3D scenes and provide an in-depth analysis of the proposed components. Our experiments with generative insertion of objects in several 3D scenes indicate the effectiveness of our method compared to the existing methods. InseRF is capable of controllable and 3D-consistent object insertion without requiring explicit 3D information as input. Please visit our project page at https://mohamad-shahbazi.github.io/inserf.

研究の動機と目的

  • 明示的な 3D 空間ガイドなしに、複雑な 3D シーンにおける 3D 一貫性を持つ生成的オブジェクト挿入という未解決の課題に取り組むこと。
  • 2D 編集の不一致と空間的制御の欠如により、オブジェクト挿入に失敗する既存の 3D 編集手法の限界を克服すること。
  • 最小限のユーザー入力で、シーンの外観、幾何学、空間的文脈を尊重する局所的かつシーンに適したオブジェクト生成を可能にすること。
  • 2D ディフュージョン事前学習と単一ビュー 3D 再構築を統合した、強固な 3D オブジェクト挿入手法の開発

提案手法

  • NeRF で再構築されたシーンの参照ビュー内で、テキストプロンプトと 2D バウンディングボックスを空間的・意味的ガイドとして用いて、3D オブジェクト挿入タスクを 2D 編集に固定する。
  • テキストから画像へのディフュージョンモデルを適用し、プロンプトと整合した意味的・視覚的整合性を持つターゲットオブジェクトを参照ビュー内に生成する。
  • 単一ビューから 3D への再構築法を用いて、2D で生成されたオブジェクトを 3D に持ち上げ、参照ビューからの形状と構造を保持する。
  • 単眼深度推定を用いて挿入オブジェクトの深度を推定し、3D 配置を誘導し、複数ビュー間での幾何学的一致性を確保する。
  • オブジェクトのサイズと深度を考慮した密度スケーリング戦略を用いて、再構築されたオブジェクト NeRF を元のシーン NeRF と統合し、視覚的調和を確保する。
  • 最終的な 3D シーンにおける照明、テクスチャ、シーンの一貫性を向上させるために、オプションのリファインメントステップを Instruct-NeRF2NeRF を用いて実施する。

実験結果

リサーチクエスチョン

  • RQ1明示的な 3D 空間入力なしに、2D バウンディングボックスとテキストプロンプトのみを用いて、複雑な 3D シーンに 3D 一貫性を持つオブジェクト挿入が可能か?
  • RQ22D ディフュージョンモデルは、複数ビューにわたる幾何学的・視覚的一致性を持つ 3D オブジェクトを生成するためにどのように活用できるか?
  • RQ3単一の 2D 参照ビューしか利用できない状況で、深度推定が正しい 3D 配置を確保するために果たす役割は何か?
  • RQ4シーンとオブジェクトの NeRF レプリカを統合する本手法の戦略が、視覚的リアリズムと一貫性に与える影響は何か?
  • RQ5本手法は、2D ベースおよび 3D ベースの編集ベースラインと比較して、局所的で生成的オブジェクト挿入においてどの程度優れているか?

主な発見

  • InseRF は、テキストプロンプトと単一の 2D バウンディングボックスのみを用いて、多様で 3D 一貫性を持つオブジェクトを複雑な 3D シーンに挿入でき、グローバルなシーンの歪みを引き起こさずに局所的な編集を実現した。
  • Instruct-NeRF2NeRF やマルチビューインpainting ベースラインと比較して、オブジェクト挿入において優れた性能を発揮し、グローバルなシーン変更や 3D フロater(浮遊オブジェクト)を回避した。
  • スケールと半径の最適化により、オブジェクト配置の正確性が著しく向上し、参照ビューとのより現実的な深度およびサイズの整合性が得られた。
  • NeRF フュージョンにおけるオブジェクト密度スケーリングにより、視覚的アーチファクトが防止され、シーン内での挿入オブジェクトの適切なレンダリングが確保された。
  • オプションのリファインメントステップにより、テクスチャの詳細と照明が向上し、シーンとのリアリズムと調和が向上した。
  • 視覚的アブレーションにより、提案された 2D ファイティング戦略が一貫性のある局所的挿入を可能にしていることが確認された。一方、ベースラインは 2D 編集の不一致と 3D 制御の欠如により失敗した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。