[論文レビュー] StylizedNeRF: Consistent 3D Scene Stylization as Stylized NeRF via 2D-3D Mutual Learning
StylizedNeRFは、2次元画像のスタイル化ネットワークとニューラルレイトランスフィールド(NeRF)を組み合わせる相互学習フレームワークを提案し、一貫性のある3次元シーンのスタイル化を実現する。NeRFから2次元スタイライザーへの空間的一致性の蒸留と、スタイルに条件づけられた学習可能なラティスコードの使用により、最先端の手法よりも優れた視覚的品質と長距離的一致性を達成する。
3D scene stylization aims at generating stylized images of the scene from arbitrary novel views following a given set of style examples, while ensuring consistency when rendered from different views. Directly applying methods for image or video stylization to 3D scenes cannot achieve such consistency. Thanks to recently proposed neural radiance fields (NeRF), we are able to represent a 3D scene in a consistent way. Consistent 3D scene stylization can be effectively achieved by stylizing the corresponding NeRF. However, there is a significant domain gap between style examples which are 2D images and NeRF which is an implicit volumetric representation. To address this problem, we propose a novel mutual learning framework for 3D scene stylization that combines a 2D image stylization network and NeRF to fuse the stylization ability of 2D stylization network with the 3D consistency of NeRF. We first pre-train a standard NeRF of the 3D scene to be stylized and replace its color prediction module with a style network to obtain a stylized NeRF. It is followed by distilling the prior knowledge of spatial consistency from NeRF to the 2D stylization network through an introduced consistency loss. We also introduce a mimic loss to supervise the mutual learning of the NeRF style module and fine-tune the 2D stylization decoder. In order to further make our model handle ambiguities of 2D stylization results, we introduce learnable latent codes that obey the probability distributions conditioned on the style. They are attached to training samples as conditional inputs to better learn the style module in our novel stylized NeRF. Experimental results demonstrate that our method is superior to existing approaches in both visual quality and long-range consistency.
研究の動機と目的
- 既存の2次元スタイル化手法が3次元幾何的認識を欠いているため、新規視点における一貫性のある3次元シーンのスタイル化を達成する課題に対処すること。
- 2次元スタイル例と3次元暗黙的表現(NeRF)との間のドメインギャップを埋めることで、効果的なスタイル化を可能にすること。
- 相互学習によりスタイライズドNeRFと2次元スタイル化ネットワークを同時に学習することで、スタイル化の品質と一貫性を向上させること。
- 2次元スタイル化出力の曖昧さがNeRFレンダリングにおけるぼやけや不一致を引き起こす問題を、スタイルに条件づけられた学習可能なラティスコードを導入することで緩和すること。
提案手法
- 3次元シーン上で標準的なNeRFを事前学習し、その色予測ヘッドをスタイルモジュールに置き換えることでスタイライズドNeRFを構築する。
- 事前学習段階で一貫性損失を用いて、NeRFから2次元スタイル化ネットワークへの空間的一致性の事前知識を蒸留する。
- スタイライズドNeRFと2次元スタイル化ネットワークの出力を一致させるためのミミック損失を導入し、知識共有を可能にする。
- スタイルに条件づけられた確率分布に従う学習可能なラティスコードとして2次元スタイル化結果をパラメータライズし、曖昧性に対する耐性を高める。
- 推論中にアーチファクトを低減するため、ラティスコードが事前学習済み分布の平均に集約されるように、分布損失$L_d$を正則化に用いる。
- ボリュームレンダリングに起因する内在的な3次元的一致性を活かし、最終的な結果としてスタイライズドNeRFのレンダリング出力を選択する。
実験結果
リサーチクエスチョン
- RQ12次元スタイル化ネットワークとNeRFとの相互学習は、高視覚的品質を維持しながら3次元シーンスタイル化の一貫性を向上させることができるか?
- RQ22次元スタイル画像と3次元NeRF表現との間のドメインギャップを、スタイル化に効果的に埋め合わせることができるか?
- RQ3スタイルに条件づけられた学習可能なラティスコードは、2次元スタイル化出力の不一致を緩和し、スタイライズドNeRFのパフォーマンスを向上させることができるか?
- RQ4NeRFから2次元ネットワークへの空間的一致性の蒸留は、スタイライズド出力の3次元的一致性を向上させるか?
- RQ5相互学習と条件付きラティスコードの組み合わせは、単独の2次元またはNeRFベースのスタイル化よりも効果的か?
主な発見
- ユーザー研究(50名の参加者、各指標1000票)による確認により、本手法は最先端の手法を上回るスタイル化品質と一貫性を達成した。
- ユーザーの好みのボックスプロットでは、両方の指標で中央値が高く、四分位範囲が狭く、本手法が顕著に優れていることが示された。
- アブレーションスタディにより、学習可能なラティスコードと2次元デコーダーの相互学習が不可欠であることが確認された。両者を除去すると、明著なアーチファクトとぼやけが生じた。
- 分布損失$L_d$は、ラティスコードが事前学習済み分布の平均に集約されることを有効に促進し、推論中のアーチファクトを低減し、結果の安定性を向上させた。
- スタイライズドNeRFの出力は、遠く離れた視点でもちらつきや不一致を起こしやすい2次元手法の出力と比較して、優れた長距離的一致性を維持した。
- 相互学習と条件付きラティスコードを統合した完全なフレームワークは、アブレーションバージョンと比較して、より明確な物体の輪郭とより現実的なスタイル化を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。