Skip to main content
QUICK REVIEW

[論文レビュー] GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions

Junjie Wang, Jiemin Fang|arXiv (Cornell University)|Nov 27, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

GaussianEditor は、3Dガウススプラッティングを用いた、繊細でテキスト誘導型の3Dシーン編集を実現する新規フレームワークである。テキストベースの注目領域(RoI)を抽出し、画像空間におけるグランドイングを介して3Dガウスに整合させ、局所的な編集を正確に制御する。優れた編集品質と20分未塔のトレーニング速度を達成し、Instruct-NeRF2NeRF などの先行手法を上回る性能を発揮する。

ABSTRACT

Recently, impressive results have been achieved in 3D scene editing with text instructions based on a 2D diffusion model. However, current diffusion models primarily generate images by predicting noise in the latent space, and the editing is usually applied to the whole image, which makes it challenging to perform delicate, especially localized, editing for 3D scenes. Inspired by recent 3D Gaussian splatting, we propose a systematic framework, named GaussianEditor, to edit 3D scenes delicately via 3D Gaussians with text instructions. Benefiting from the explicit property of 3D Gaussians, we design a series of techniques to achieve delicate editing. Specifically, we first extract the region of interest (RoI) corresponding to the text instruction, aligning it to 3D Gaussians. The Gaussian RoI is further used to control the editing process. Our framework can achieve more delicate and precise editing of 3D scenes than previous methods while enjoying much faster training speed, i.e. within 20 minutes on a single V100 GPU, more than twice as fast as Instruct-NeRF2NeRF (45 minutes -- 2 hours).

研究の動機と目的

  • 自然言語による指示に従い、細かく局所的な3Dシーン編集を可能にすること。
  • 2Dの拡散モデルを3Dシーンに適用する際の編集領域の局所化の限界を克服すること。
  • 3Dガウスの明示的かつ点単位の性質を活用し、正確で個別化された編集制御を実現すること。
  • 従来のNeRFベースの編集手法と比較して、トレーニング時間を短縮しつつ編集の正確性を向上させること。
  • マルチモーダルなコンponents(LLM、グランドイングモデル、3Dガウス)を統合した一元的でインタラクティブな編集パイプラインを構築すること。

提案手法

  • 大規模言語モデル(LLM)を用いてテキスト指示から注目領域(RoI)を抽出し、主な編集ターゲットを特定する。
  • グランドイングセグメンテーションモデルを用いて、2D画像空間におけるRoIを局所化し、画像レベルのRoIマスクを生成する。
  • RoIリフトモジュールを適用して、2D画像のRoIを3Dガウス空間に再投影し、漏れやノイズを最小限に抑える。
  • テキストおよび空間的制約に条件付けられた拡散モデルを用いて、洗練されたRoI内での3Dガウスに対する局所的編集を実行する。
  • ユーザーが提供する3Dボックスやポイント選択を介して、インタラクティブに編集領域をさらに洗練できる。
  • シーンの説明生成を統合することで、空間的関係の理解を向上させ、指示のグランドイングを強化する。

実験結果

リサーチクエスチョン

  • RQ1テキスト誘導型の編集において、3Dガウススプラッティングは、暗黙的NeRFベースの手法と比較して、より正確で局所的な3Dシーン編集を可能にするか?
  • RQ2テキストベースの注目領域(RoI)を3D空間に効果的に局所化することで、グローバルまたはノイズの多い編集を回避できるか?
  • RQ3LLM、グランドイングモデル、3Dガウス操作を組み合わせたマルチステージパイプラインは、エンドツーエンドの拡散ベース手法と比較して、より高速かつ正確な編集を実現できるか?
  • RQ4シーンの説明生成は、編集タスクにおける空間的理解の正確性を向上させるために果たす役割は何か?
  • RQ5RoIリフトモジュールは、不完全な2Dセグメンテーションに起因するノイズと漏れを効果的に低減するか?

主な発見

  • GaussianEditor は、特に特定のオブジェクト部品への変更の局所化において、Instruct-NeRF2NeRF よりもはるかに繊細かつ正確な編集を達成している。
  • 単一の V100 GPU で20分未塔のトレーニング時間を達成しており、これは Instruct-NeRF2NeRF(45分〜2時間)の2倍以上速い。
  • アブレーションスタディの結果、すべてのコンponents(ガウスRoI、テキストRoI、RoIリフト)が不可欠であることが確認され、いずれかが欠落すると著しい編集漏れや失敗が生じる。
  • シーンの説明生成により、空間的関係の理解が正確に可能となり、自転車の隣のベンチの正しい編集が可能になったのに対し、ベースラインでは失敗していた。
  • RoIリフトモジュールは、不完全な2Dセグメンテーションに起因するノイズと漏れを効果的に低減し、3D編集の忠実度を向上させた。
  • ユーザーのインタラクティブな制御(例:3Dボックス、ポイント選択)により、複数ラウンドにわたる繊細な編集が可能となり、ユーザビリティが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。