Skip to main content
QUICK REVIEW

[論文レビュー] Edit-DiffNeRF: Editing 3D Neural Radiance Fields using 2D Diffusion Model

Lu Yu, Wei Xiang|arXiv (Cornell University)|Jun 15, 2023
3D Shape Modeling and Analysis被引用数 5
ひとこと要約

Edit-DiffNeRF は、固定された 2D ディフュージョンモデルと学習可能なデルタモジュールを用いて、潜在的意味空間を編集することで、現実世界の 3D NeRF シーンをテキストプロンプトで制御可能な細分化された編集を可能にする新規フレームワークを提案する。この手法により、テキストプロンプトに従った高精度でマルチビュー一貫性のある編集が実現され、従来手法 Instruct-NeRF2NeRF よりも 25% 高いテキスト指示との整合性を達成する。

ABSTRACT

Recent research has demonstrated that the combination of pretrained diffusion models with neural radiance fields (NeRFs) has emerged as a promising approach for text-to-3D generation. Simply coupling NeRF with diffusion models will result in cross-view inconsistency and degradation of stylized view syntheses. To address this challenge, we propose the Edit-DiffNeRF framework, which is composed of a frozen diffusion model, a proposed delta module to edit the latent semantic space of the diffusion model, and a NeRF. Instead of training the entire diffusion for each scene, our method focuses on editing the latent semantic space in frozen pretrained diffusion models by the delta module. This fundamental change to the standard diffusion framework enables us to make fine-grained modifications to the rendered views and effectively consolidate these instructions in a 3D scene via NeRF training. As a result, we are able to produce an edited 3D scene that faithfully aligns to input text instructions. Furthermore, to ensure semantic consistency across different viewpoints, we propose a novel multi-view semantic consistency loss that extracts a latent semantic embedding from the input view as a prior, and aim to reconstruct it in different views. Our proposed method has been shown to effectively edit real-world 3D scenes, resulting in 25% improvement in the alignment of the performed 3D edits with text instructions compared to prior work.

研究の動機と目的

  • 事前学習済みのディフュージョンモデルと NeRF を用いたテキストから 3D への編集におけるビュー間不一致および 3D の整合性の欠如を解消すること。
  • 各シーンごとにディフュージョンモデルを微調整せずに、微細な制御可能な 3D シーン編集を可能にすること。
  • 新規のマルチビュー意味的整合性損失を用いて、3D 編集中に複数のビュー間での意味的整合性を保証すること。
  • 従来の手法(例: Instruct-NeRF2NeRF)を上回る、テキスト指示とレンダリングされた 3D シーン編集との整合性を向上させること。
  • 固定されたディフュージョンプライアを用いて、実物撮影された NeRF シーンに対して写真同等の質で一貫性のある 3D 編集を実現すること。

提案手法

  • フレームワークは、NeRF シーンの各ビューに対して、固定された事前学習済み 2D ディフュージョンモデルを用いて潜在埋め込みを生成する。
  • テキストプロンプトに基づいて、CLIP 距離損失をガイドとして用いることで、潜在空間を編集するための学習可能なデルタモジュールを訓練する。
  • 編集された潜在埋め込みは 2D 画像に復元され、その画像を用いて NeRF を訓練して 3D シーン再構築を行う。
  • 異なるビュー間で共通の潜在プライアを再構築するために、マルチビュー意味的整合性損失を導入し、3D の整合性を保証する。
  • CLIP を用いた損失と整合性損失を組み合わせて、NeRF とデルタモジュールをエンドツーエンドで最適化する。
  • 各シーンごとにディフュージョンモデルを微調整せず、効率的で一貫性のある編集を実現するために、潜在空間におけるデルタの学習に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1各シーンごとにディフュージョンモデルを微調整せずに、微細なテキスト誘導型 3D シーン編集を実現できるか?
  • RQ22D ディフュージョンプライアを用いた場合、3D 編集中に複数のビュー間で意味的整合性をどのように保証できるか?
  • RQ3固定されたディフュージョンモデルの潜在空間にデルタモジュールを導入することで、テキスト指示を効果的に 3D シーン編集に反映できるか?
  • RQ4提案されたマルチビュー意味的整合性損失は、3D の整合性と編集の正確性を顕著に向上させるか?
  • RQ5SOTA メソッド(例: Instruct-NeRF2NeRF)と比較して、Edit-DiffNeRF はテキストから画像およびテキストから 3D への整合性において優れているか?

主な発見

  • CLIP のテキスト-画像類似度を用いた測定において、Edit-DiffNeRF は Instruct-NeRF2NeRF よりも 25% 高いテキスト-3D 編集整合性を達成した。
  • 従来の手法に見られるマルチビュー不一致やぼやけやノイズなどのレンダリングアーティファクトが顕著に低減された。
  • マルチビュー意味的整合性損失を除去すると 3D の整合性が低下し、シーンの整合性を維持する上でその損失が極めて重要な役割を果たしていることが示された。
  • アブレーションスタディにより、デルタモジュール単体でもベースライン手法を上回るが、整合性損失を含むフルフレームワークが最も優れた結果を達成した。
  • Edit-DiffNeRF は、実物撮影された NeRF シーンに対して写真同等の質で一貫性のある 3D 編集を生成し、視覚的品質および整合性の両面で CLIP-NeRF や Instruct-NeRF2NeRF を上回った。
  • 色の変更(例: 雪の効果)、オブジェクトの削除(例: ベアスタットゥーの除去)、複雑な変更(例: チェッカー柄のジャケットの追加)など、多様な編集に対して堅牢であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。