[論文レビュー] NeRF-Art: Text-Driven Neural Radiance Fields Stylization
NeRF-Artは、テキストプロンプトのみを用いて事前学習済みNeRFの外観と形状を同時に操作するテキスト駆動型ニューラルレイトランスフィールドスタイル化手法を提案する。グローバル・ローカルの対照的損失と方向性のあるCLIPガイドライン、および重み正則化を組み合わせることで、メッシュの監視を必要とせず、一貫性があり高品質なスタイル化を実現し、アーティファクトを効果的に抑制し、視点間で一様なスタイル転送を可能にする。
As a powerful representation of 3D scenes, the neural radiance field (NeRF) enables high-quality novel view synthesis from multi-view images. Stylizing NeRF, however, remains challenging, especially on simulating a text-guided style with both the appearance and the geometry altered simultaneously. In this paper, we present NeRF-Art, a text-guided NeRF stylization approach that manipulates the style of a pre-trained NeRF model with a simple text prompt. Unlike previous approaches that either lack sufficient geometry deformations and texture details or require meshes to guide the stylization, our method can shift a 3D scene to the target style characterized by desired geometry and appearance variations without any mesh guidance. This is achieved by introducing a novel global-local contrastive learning strategy, combined with the directional constraint to simultaneously control both the trajectory and the strength of the target style. Moreover, we adopt a weight regularization method to effectively suppress cloudy artifacts and geometry noises which arise easily when the density field is transformed during geometry stylization. Through extensive experiments on various styles, we demonstrate that our method is effective and robust regarding both single-view stylization quality and cross-view consistency. The code and more results can be found in our project page: https://cassiepython.github.io/nerfart/.
研究の動機と目的
- メッシュの監視を必要とせず、テキストプロンプトのみで外観と形状を同時に変更できるNeRFのテキストガイド付きスタイル化を実現すること。
- 既存のNeRFスタイル化手法における一貫性のないスタイル化強度と低い視点間一貫性の課題に対処すること。
- NeRFスタイル化における形状変形に伴い生じる曇りアーティファクトおよび幾何的ノイズを抑制すること。
- 自然言語プロンプトのみを用いて、一様で意味的に意味のあるスタイル転送を実現すること。
- 多様なスタイルとNeRFに類似したアーキテクチャ(VolSDFやNeuSを含む)にわたる堅牢性を示すこと。
提案手法
- 局所的な画像パッチと全体のシーンの両方における一貫性のあるスタイル強度を保証するグローバル・ローカル対照的学習戦略を導入する。
- 方向性のあるCLIPガイドラインを用いて、テキストプロンプトの意味的方向に沿ったスタイル化の軌道を整列させる。
- 密度場の集中を促進し、形状変形中の曇りアーティファクトを低減するために重み正則化損失を適用する。
- 2段階の最適化プロセスを採用:まず対照的損失によりスタイル化済NeRFの特徴をテキストプロンプトと一致させ、次に方向制約で精緻化する。
- CLIPの視覚言語埋め込みを活用し、参照画像や明示的な幾何的監視を必要とせず、外観と形状の両方の変換をガイドする。
- VolSDF や NeuS などのモデルに同じ損失および最適化フレームワークを適用することで、異なるNeRFアーキテクチャに適応するスタイル化プロセスを調整する。
実験結果
リサーチクエスチョン
- RQ1テキストプロンプトのみで、外観と形状を同時に変更する一貫性があり高品質なNeRFスタイル化を実現できるか?
- RQ2グローバルおよびローカルの対照的学習をどのように組み合わせることで、3次元シーン全体にわたる一様なスタイル転送を達成できるか?
- RQ3方向性のあるCLIPガイドラインは、スタイル転送の軌道と強度を制御するために果たす役割は何か?
- RQ4重み正則化は、NeRFスタイル化における幾何的アーティファクトおよび密度ノイズを効果的に抑制できるか?
- RQ5本手法は、異なるNeRFアーキテクチャおよび多様な芸術的スタイルにどの程度一般化できるか?
主な発見
- 提案されたグローバル・ローカル対照的損失は、グローバルまたはローカル損失を単独で使用する場合と比較して、異なる領域における過剰・不足スタイル化の問題を顕著に改善し、一貫性のあるスタイル化を実現した。
- 方向性のあるCLIPガイドラインと対照的学習を組み合わせることで、より意味的に整合性のあるスタイル化結果を得るための正確なスタイル軌道制御が可能になった。
- 重み正則化は、曇りアーティファクトおよび幾何的ノイズを効果的に抑制し、特に高い変形が生じる領域で顕著な効果を示した(定性的比較による確認)。
- 本手法は、人間の顔や抽象的環境など複雑なシーンに対しても、複数の視点で一貫性があり視覚的に魅力的なスタイル化を実現した。
- NeRF-Artは、VolSDF や NeuS などの異なるNeRFに類似したモデルに対しても良好に一般化し、アーキテクチャ間での転送性を示した。
- 曇りや意味のないプロンプト(例:「デジタルペインティング」や「口バットマン」)では、予期しないまたは意味のない結果が生じるという制限が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。