Skip to main content
QUICK REVIEW

[論文レビュー] ConRF: Zero-shot Stylization of 3D Scenes with Conditioned Radiation Fields

Xingyu Miao, Yang Bai|arXiv (Cornell University)|Feb 2, 2024
3D Surveying and Cultural HeritageEarth and Planetary Sciences被引用数 3
ひとこと要約

ConRFは、再訓練を必要とせず、テキストまたは画像リファレンスを用いてゼロショット3次元シーンのスタイリングを可能にする。CLIP特徴量をVGGベースのスタイリング空間にマッピングし、局所的スタイリング転送を可能にする3次元ボリューム選択ボリュームを採用することで、新しいビュー生成における最先端の視覚的品質と一貫性を達成する。

ABSTRACT

Most of the existing works on arbitrary 3D NeRF style transfer required retraining on each single style condition. This work aims to achieve zero-shot controlled stylization in 3D scenes utilizing text or visual input as conditioning factors. We introduce ConRF, a novel method of zero-shot stylization. Specifically, due to the ambiguity of CLIP features, we employ a conversion process that maps the CLIP feature space to the style space of a pre-trained VGG network and then refine the CLIP multi-modal knowledge into a style transfer neural radiation field. Additionally, we use a 3D volumetric representation to perform local style transfer. By combining these operations, ConRF offers the capability to utilize either text or images as references, resulting in the generation of sequences with novel views enhanced by global or local stylization. Our experiment demonstrates that ConRF outperforms other existing methods for 3D scene and single-text stylization in terms of visual quality.

研究の動機と目的

  • 各新しいスタイリングごとに再訓練を必要とする従来の3次元スタイリング転送手法の制限を解消すること。
  • テキストまたは画像リファレンスを条件因子として用いて、3次元シーンのゼロショットスタイリングを可能にすること。
  • 芸術的スタイリングを捉える際のCLIP特徴量の曖昧さを解消するため、VGGベースのスタイリング空間へのマッピングを実施すること。
  • テキストプロンプトを用いて局所的スタイリング転送を実現する3次元ボリューム選択メカニズムを導入すること。
  • 各スタイリングごとにモデルを微調整せずに、高精細で一貫性のあるスタイリングを新ビューに適用すること。

提案手法

  • テキストプロンプトまたはリファレンス画像からCLIPのテキストおよび画像エンコーダーを用いて特徴量を抽出する。
  • CLIP特徴量をVGG特徴空間にマップするためのマッピングネットワークを訓練し、スタイリング表現の曖昧さを低減する。
  • マップされたスタイリング特徴量をニューラルレディエーションフィールドに統合し、3次元シーン全体のスタイリングを実現する。
  • テキストプロンプトに基づいた局所的スタイリング転送を可能にするために、マルチスケールの空間特徴量抽出を備えた3次元選択ボリュームを導入する。
  • スタイリングの忠実度とビューの一貫性を維持するために、トレーニング中にスタイリング特徴量損失および一貫性損失を適用する。
  • CLIPのゼロショット画像・テキストマッチングを用いて、再訓練なしに未学習のテキストまたは画像リファレンスを条件として推論を実行する。

実験結果

リサーチクエスチョン

  • RQ1CLIP特徴量をVGGベースのスタイリング空間に効果的にマッピングすることで、ゼロショット3次元スタイリングが可能になるか?
  • RQ2テキストプロンプトのみを条件因子として用いて、3次元シーンにおける局所的スタイリング転送をどのように実現できるか?
  • RQ3マッピングネットワークおよび損失部の構成が、スタイリング品質および一貫性に与える影響は何か?
  • RQ4再訓練なしに、未学習のテキストまたは画像リファレンスに一般化可能か?
  • RQ53次元選択ボリュームは、局所的スタイリング適用における細かい制御をどのように可能にするか?

主な発見

  • ベースラインのStyleRFと比較して、短距離LPIPSは31%、長距離LPIPSは59.4%改善され、ビューの一貫性が優れていることが示された。
  • テキストベースのスタイリングにおいて、CLIPStylerおよびCLIP-NeRFを上回り、テキストによるスタイリング記述とより良好に一致することが実証された。
  • アブレーションスタディにより、マッピングモジュールを削除するとスタイリング転送の品質が著しく低下することが確認され、その必要性が示された。
  • 一貫性損失はスタイリング品質を顕著に向上させ、スタイリング特徴量損失はリファレンススタイリングへの忠実度を向上させた。
  • マルチスケール特徴量抽出戦略における窓サイズが32の場合、局所的スタイリング転送のための最もクリアで正確なマスクが得られた。
  • 制限事項として、テキストが画像に含まれるスタイル(例:青色のテキスト)の処理が不十分であり、現在のところ局所的スタイリングでは顔を正面に向けて撮影されたシーンに限定されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。