[論文レビュー] InNeRF360: Text-Guided 3D-Consistent Object Inpainting on 360-degree Neural Radiance Fields
InpaintNeRF360 は、テキスト誘導型で 3D 一貫性を持つ、非有界な NeRF シーン向けのインpainting フレームワークを提案する。テキストからマルチモーダルプロンプトを介してプロンプタブルなセグメンテーションモデル(SAM)を誘導し、深度空間ワープを用いて視点一貫性のあるオブジェクト除去を実現する。2D 画像インpainting の事前学習を NeRF のファインチューニングと組み合わせ、知覚的損失と L1 損失を用いることで、写真同等の質で幾何学的感覚を持つ 3D インpainting を実現する。自然言語による指示からの正確でマルチオブジェクト編集が可能である。
We propose InNeRF360, an automatic system that accurately removes text-specified objects from 360-degree Neural Radiance Fields (NeRF). The challenge is to effectively remove objects while inpainting perceptually consistent content for the missing regions, which is particularly demanding for existing NeRF models due to their implicit volumetric representation. Moreover, unbounded scenes are more prone to floater artifacts in the inpainted region than frontal-facing scenes, as the change of object appearance and background across views is more sensitive to inaccurate segmentations and inconsistent inpainting. With a trained NeRF and a text description, our method efficiently removes specified objects and inpaints visually consistent content without artifacts. We apply depth-space warping to enforce consistency across multiview text-encoded segmentations, and then refine the inpainted NeRF model using perceptual priors and 3D diffusion-based geometric priors to ensure visual plausibility. Through extensive experiments in segmentation and inpainting on 360-degree and frontal-facing NeRFs, we show that our approach is effective and enhances NeRF's editability. Project page: https://ivrl.github.io/InNeRF360.
研究の動機と目的
- implicit NeRF表現における 3D シーン編集の課題、特に 360° 視点間で幾何学的・光沢的整合性を保ったオブジェクト除去を解決すること。
- 視点間での形状変化に起因して非有界シーンで失敗する 2D ベースのインパインティング手法の限界を克服すること。
- マニュアルセグメンテーションマスクを必要とせず、自然言語指示による直感的で直感的な 3D 編集を可能にし、ユーザーのアクセス性と制御性を向上させること。
- マルチビュー監視と知覚的事前知識を活用して、インパインティングされた 3D シーンにおける視点一貫性と視覚的妥当性を保証すること。
提案手法
- テキスト指示をマルチモーダルプロンプトにエンコードし、セグメンテーション・アダプティブ・モデル(SAM)を用いたマルチビューインスタンスセグメンテーションを誘導する。
- 深度空間ワープを適用して、2D セグメンテーションマスクを視点間で伝搬・精錬し、オブジェクトの 3D 身元の一貫性を強制する。
- 事前学習済みの画像インパインターが、セグメンテーションマスクを用いてマルチビュー画像上で視覚的に妥当な 2D インパインティング結果を生成する。
- ピixe単位の L1 損失とマスク付き知覚的損失(LPIPS)を組み合わせたハイブリッド損失を用いて、NeRF モデルをファインチューニングする。これにより視覚的一致性を維持する。
- ファインチューニング中に事前学習済み NeRF の 3D 一貫性を活用することで、視点一貫性をさらに強化する。
- フレームワークは、プロンプト工学を必要とせず、自然言語プロンプトに基づいて複数のオブジェクトを編集したり、オブジェクトの外観を変更したりすることを可能にする。
実験結果
リサーチクエスチョン
- RQ1テキスト誘導型 3D インパインティングは、非有界な NeRF シーンにおいて 360° 視点間で一貫したオブジェクト除去を達成できるか?
- RQ2深度空間ワープは、マルチビューでのセグメンテーションにおいて、3D オブジェクトの身元の一貫性を維持するのにどの程度効果的か?
- RQ32D 画像インパインティングの事前知識と NeRF ファインチューニングを組み合わせることで、視覚的に妥当で視点一貫性のある 3D 結果が得られるか?
- RQ4時間的・視点一貫性の観点から、フレーム単位のインパインティングと比較して、本手法はどの程度優れているか?
- RQ5マニュアルマスク入力なしに、自然言語指示のみで正確なオブジェクトレベルの編集が可能か?
主な発見
- 庭のシーンにおいて、InpaintNeRF360 は視点一貫性について 86% のユーザー選好を達成し、フレーム単位のインパインティング(14% 選好)を上回った。
- Cup および Starbucks データセットにおいて、InpaintNeRF360 は LPIPS 0.6201、FID 168.39 を達成し、フレーム単位のインパインティング(LPIPS: 0.6375、FID: 181.57)を上回った。
- マスク付き知覚的損失の導入により、3D シーンにおけるぼやけたアーティファクトが低減された。L1 損失のみの訓練では広範囲にわたるぼやけが顕著に見られた。
- 1つのテキスト指示「花の鉢と花を除去」により、複数のオブジェクトを同時に除去することができた。
- マスク条件付き画像エディタに変更された場合、InpaintNeRF360 は正確なオブジェクトスタイリングが可能であるのに対し、In2n は意図しない広範囲にわたりスタイリングを適用していた。
- フレームワークは非有界および前面を向いたシーンに一般化でき、多様な現実世界のデータセットにおいても堅牢性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。