Skip to main content
QUICK REVIEW

[論文レビュー] SinNeRF: Training Neural Radiance Fields on Complex Scenes from a Single Image

Dejia Xu, Yifan Jiang|arXiv (Cornell University)|Apr 2, 2022
Image Enhancement Techniques被引用数 4
ひとこと要約

SinNeRFは、複雑なシーンにおける1枚の画像からのNeural Radiance Fieldsの学習を、幾何学的および意味的偽ラベルを用いて多視点一致性と視覚的質を強制することで、半教師ありフレームワークとして提案する。マルチビューの教師なしまたは大規模データセットでの事前学習が不要であるにもかかわらず、最先端の新規ビュー合成結果を達成する。

ABSTRACT

Despite the rapid development of Neural Radiance Field (NeRF), the necessity of dense covers largely prohibits its wider applications. While several recent works have attempted to address this issue, they either operate with sparse views (yet still, a few of them) or on simple objects/scenes. In this work, we consider a more ambitious task: training neural radiance field, over realistically complex visual scenes, by "looking only once", i.e., using only a single view. To attain this goal, we present a Single View NeRF (SinNeRF) framework consisting of thoughtfully designed semantic and geometry regularizations. Specifically, SinNeRF constructs a semi-supervised learning process, where we introduce and propagate geometry pseudo labels and semantic pseudo labels to guide the progressive training process. Extensive experiments are conducted on complex scene benchmarks, including NeRF synthetic dataset, Local Light Field Fusion dataset, and DTU dataset. We show that even without pre-training on multi-view datasets, SinNeRF can yield photo-realistic novel-view synthesis results. Under the single image setting, SinNeRF significantly outperforms the current state-of-the-art NeRF baselines in all cases. Project page: https://vita-group.github.io/SinNeRF/

研究の動機と目的

  • 複雑なシーンにおいて、密度の高いマルチビューのカバレッジがなくても、1枚の参照画像のみを用いてNeural Radiance Fieldsの学習を可能にすること。
  • 深度や構造的事前知識が欠落しているため、従来の手法が失敗するような、1枚の画像からの3次元幾何構造再構築とビュー合成の課題に対処すること。
  • マルチビューの教師なし状況下で、偽ラベルを活用して学習プロセスを安定化・誘導する半教師あり学習戦略を開発すること。
  • 大規模なマルチビューデータセットでの事前学習や特化したアーキテクチャへの依存なしに、写真同等の新規ビュー合成を達成すること。

提案手法

  • 参照視点と未学習視点間の画像ワープを用いて、幾何学的偽ラベルを生成・伝搬する半教師あり学習フレームワークを導入し、多視点幾何的一致性を確保する。
  • 生成された意味的偽ラベルが、新規ビューにおける局所的テクスチャ品質とグローバルな構造的忠実度をガイドするため、ディスクリミネーターと事前学習済みVision Transformer (ViT) を用いる。
  • 幾何的監視、局所的テクスチャの現実性を向上させる adversarial loss、および DINO-ViT からの [CLS] テンキーに基づく対照的損失を組み合わせたマルチ損失学習目的を採用する。
  • 深度監視は参照視点でのみ適用し、未学習視点の正則化には偽ラベル化された幾何的および意味的事前知識を用いる。
  • 画像ワープを活用して、参照視点からの深度を未学習視点に再投影し、明示的なマルチビュー監視なしに、視点間で一貫した3次元幾何を実現する。
  • 偽ラベルを段階的に改善・伝搬することで一般化性能を向上させ、モード崩壊を低減するため、プログレッシブな学習戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1マルチビューの教師なし状況下で、複雑なシーンにおける1枚の画像からのNeural Radiance Fieldsの有効な学習が可能か?
  • RQ21枚の画像から幾何的および意味的事前知識をどのように合成し、NeRF学習の安定化に寄与させるか?
  • RQ3幾何的偽ラベルと意味的偽ラベルの両者が、新規ビュー合成品質向上に果たす相対的寄与度は何か?
  • RQ4偽ラベルを用いた半教師ありフレームワークが、既存の最先端手法を上回る性能を発揮できるか?

主な発見

  • SinNeRFは、NeRF合成、LLFF、DTU データセットを含む複雑なシーンベンチマークで最先端の性能を達成し、マルチビューデータでの事前学習が不要である。
  • DTU データセットでは、PSNR 20.97、SSIM 0.82、LPIPS 0.0932 を達成し、DS-NeRF、PixelNeRF、DietNeRF と比較して定量的および定性的に優れた結果を示した。
  • アブレーションスタディの結果、幾何的偽ラベルを除去すると顕著な幾何的誤差が生じる一方、意味的偽ラベルを除去すると構造アーチファクトや誤ったグローバルレイアウトが発生した。
  • DINO-ViT の [CLS] テンキーを用いたグローバル構造事前知識の利用は、VGGベースのコンテンツ・スタイル・自己類似性損失と比較して優れた性能を示し、ピクセルのずれに強く対処できることを示した。
  • 敵対的学習を含まないバリアントでは、曇りがかったアーチファクトが発生し、ディスクリミネーターによる局所的テクスチャガイドの重要性が裏付けられた。
  • 全コンポonentを備えたモデルが最良の結果を達成し、グローバル構造事前知識が欠落したバリアントと比較して2.77のPSNR向上、ベースラインと比較して0.0987のLPIPS改善を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。