[論文レビュー] CLIP-NeRF: Text-and-Image Driven Manipulation of Neural Radiance Fields
CLIP-NeRFは、CLIPの共同埋め込み空間を活用することで、テキストおよび画像駆動型のニューラルレイトランスフィールド(NeRF)の操作を統合的に実現するフレームワークを提案する。分離された条件付きNeRFアーキテクチャを採用し、形状と外観のコードを別々に制御する。これにより、CLIP埋め込みを潜在的編集に変換するフィードフォワードコードマッパーが導入され、リアルな画像の逆投影と視点一貫性を持つ高速で制御可能で高精度な3D編集を実現する。
We present CLIP-NeRF, a multi-modal 3D object manipulation method for neural radiance fields (NeRF). By leveraging the joint language-image embedding space of the recent Contrastive Language-Image Pre-Training (CLIP) model, we propose a unified framework that allows manipulating NeRF in a user-friendly way, using either a short text prompt or an exemplar image. Specifically, to combine the novel view synthesis capability of NeRF and the controllable manipulation ability of latent representations from generative models, we introduce a disentangled conditional NeRF architecture that allows individual control over both shape and appearance. This is achieved by performing the shape conditioning via applying a learned deformation field to the positional encoding and deferring color conditioning to the volumetric rendering stage. To bridge this disentangled latent representation to the CLIP embedding, we design two code mappers that take a CLIP embedding as input and update the latent codes to reflect the targeted editing. The mappers are trained with a CLIP-based matching loss to ensure the manipulation accuracy. Furthermore, we propose an inverse optimization method that accurately projects an input image to the latent codes for manipulation to enable editing on real images. We evaluate our approach by extensive experiments on a variety of text prompts and exemplar images and also provide an intuitive interface for interactive editing. Our implementation is available at https://cassiepython.github.io/clipnerf/
研究の動機と目的
- 自然言語または参照画像を用いて、直感的でユーザーフレンドリーなNeRFの3Dコンテンツ操作を可能にすること。
- 1シーンごとの最適化とマルチビュー依存性により、編集が困難な暗黙的NeRF表現の編集課題に取り組むこと。
- 条件付き潜在的空間アーキテクチャを用いて、NeRFにおける形状と外観の制御を分離すること。
- 実際の画像を条件付きNeRFモデルの潜在空間に逆投影することで、現実世界のデータの編集を可能にすること。
- 教師データを必要とせず、CLIPベースの損失を用いて高精度で視点一貫性を持つ編集を達成すること。
提案手法
- 形状は位置符号化に適用される学習済みの変形場によって制御され、外観は体積レンダリング中にモodulatedされる、分離された条件付きNeRFアーキテクチャを提案する。
- テキストまたは画像からのCLIP埋め込みを形状および外観の潜在的コードにマップする2つのフィードフォワードコードマッパーを設計し、高速な推論を実現する。
- 入力プロンプトまたは画像の意味的コンテンツとレンダリング出力の整合性を保つために、CLIPベースの一致損失を用いる。
- 1枚の実画像から形状および外観の潜在的コードを推定する逆最適化法を導入し、現実世界のデータの編集を可能にする。
- 連続的な編集を可能とするために、形状と外観を順次変更し、潜在空間における編集方向に沿った補間およびスケーリングを実現する。
- 訓練中にCLIP損失を計算するためにパッチベースのレイサンプラーを用い、生成されたビューと入力制約との間の整合性を向上させる。
実験結果
リサーチクエスチョン
- RQ1統合的なフレームワークは、高精度で視点一貫性を持つNeRFのテキストおよび画像駆動型編集を可能にするか?
- RQ2条件付きNeRFアーキテクチャにおいて、形状と外観を効果的に分離し、独立した操作を可能にするか?
- RQ3微調整なしに、CLIP埋め込みを正確かつ汎用的な3D編集に適した潜在的コードに効果的にマッピングできるか?
- RQ4実際の画像を条件付きNeRFの潜在空間に逆投影することで、現実世界の3Dコンテンツの編集が可能になるか?
- RQ5潜在空間におけるスケーリングと補間は、直感的で段階的な編集効果を生み出すか?
主な発見
- テキストプロンプトまたは例示画像のみを用いても、高品質で視点一貫性を持つ3D編集が達成され、意味的整合性と視覚的妥当性が確認された。
- CLIPベースの損失により、教師データを必要とせず、LLFFデータセット上で検証されたゼロショットでのNeRF外観および形状の編集が可能になった。
- フィードフォワードコードマッパーにより、同じカテゴリの複数オブジェクトに対する高速な推論が可能となり、最適化ベースのベースラインを上回る速度性能を示した。
- 逆投影法により、実画像が潜在空間に効果的に投影され、一貫性のある幾何構造と外観を維持した現実世界の3Dコンテンツ編集が可能になった。
- 編集方向に沿ったスケーリングにより、段階的で直感的な編集が得られ、潜在空間における補間により、形状および外観の間で滑らかな遷移が実現された。
- アブレーションスタディの結果、潜在空間の制約なしに単一のNeRFを直接編集すると形状編集に失敗することが判明し、分離された潜在表現の必要性が強調された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。