Skip to main content
QUICK REVIEW

[論文レビュー] SPARF: Neural Radiance Fields from Sparse and Noisy Poses

Prune Truong, Marie‐Julie Rakotosaona|arXiv (Cornell University)|Nov 21, 2022
Advanced Vision and Imaging被引用数 5
ひとこと要約

SPARFは、ノイズが混じったカメラポーズを伴う3枚のスパarsely、広基線の画像からNeural Radiance Fields(NeRF)を訓練するための新しい手法を提案する。ピクセル対応関係と深度整合性損失を通じてマルチビュー幾何制約を活用することで、SPARFはNeRFとカメラポーズを共同で最適化し、DTU、LLFF、Replicaデータセットにおいて極めてスパースでポーズノイズが大きい状況下でも最先端の新視点合成性能を達成する。

ABSTRACT

Neural Radiance Field (NeRF) has recently emerged as a powerful representation to synthesize photorealistic novel views. While showing impressive performance, it relies on the availability of dense input views with highly accurate camera poses, thus limiting its application in real-world scenarios. In this work, we introduce Sparse Pose Adjusting Radiance Field (SPARF), to address the challenge of novel-view synthesis given only few wide-baseline input images (as low as 3) with noisy camera poses. Our approach exploits multi-view geometry constraints in order to jointly learn the NeRF and refine the camera poses. By relying on pixel matches extracted between the input views, our multi-view correspondence objective enforces the optimized scene and camera poses to converge to a global and geometrically accurate solution. Our depth consistency loss further encourages the reconstructed scene to be consistent from any viewpoint. Our approach sets a new state of the art in the sparse-view regime on multiple challenging datasets.

研究の動機と目的

  • 密なビューと正確なポーズが入手できない現実世界のシナリオにおけるNeRFの限界を解消すること。
  • ノイズ混じりのカメラポーズを伴う3枚の広基線画像からも、写真同等の新視点合成を可能にすること。
  • 幾何的制約を用いてNeRFとカメラポーズを共同で最適化することで、退化した再構成を回避すること。
  • 標準的なNeRFやポーズ最適化手法が失敗するスパースビュー環境におけるロバストネスと一般化性能を向上させること。
  • シーン形状の事前知識や事前学習済み条件付きモデルに依存せず、ビュー間の幾何的整合性から学習することで、ゼロショット一般化を可能にすること。

提案手法

  • 事前学習済みのマッチングモデル(例:PDC-Net)を用いて、入力ビュー間のピクセル対応関係を抽出する。
  • NeRFでレンダリングされた深度と推定されたポーズを用いて再投影誤差を最小化するマルチビュー対応損失を導入する。
  • トレーニングビューからのレンダリング深度を用いて、新規視点のための疑似真値深度を生成する深度整合性損失を採用する。
  • エンドツーエンド学習により、すべてのビューで幾何的整合性を強制しながら、NeRFとカメラポーズを共同で最適化する。
  • マルチビュー幾何の原則に依存して最適化空間を制限し、グローバルに整合性のある解への収束を保証する。
  • シーン形状の事前知識や条件付きモデルを仮定せず、ゼロショットで新シーンに一般化可能である。

実験結果

リサーチクエスチョン

  • RQ1ノイズ混じりのカメラポーズを伴う3枚の画像でのみ学習したNeRFが、高精度な新視点合成を達成できるか?
  • RQ2複数ビュー間の幾何的整合性が、スパースビュー領域におけるNeRF最適化を改善できるか?
  • RQ3ピクセルマッチングに基づくマルチビュー対応損失は、個別画像損失よりも優れたポーズ最適化を達成できるか?
  • RQ4真値深度が存在しない新規視点からのレンダリング品質を、深度整合性損失が向上させられるか?
  • RQ5事前学習済み条件付きモデルや完全なポーズに依存せずに、スパースビュー新視点合成で最先端の性能を達成できるか?

主な発見

  • SPARFはDTUデータセットで新たなSOTAを樹立し、3枚の入力ビューとノイズ混じりのポーズで20.20 PSNR、0.63 SSIM、0.24 FIDを達成した。
  • LLFFデータセットでは、MVSNeRFなどの条件付きモデルを含むすべてのベースラインを上回り、3枚の入力ビューで23.35 PSNRと0.74 SSIMを達成した。
  • Replicaデータセットでは、COLMAPによるノイズ混じりのマッチングで初期ポーズが推定されても、正確な深度を有するリアルな新視点レンダリングを生成した。
  • SPARFはスパース領域における標準NeRFやBARFを著しく上回り、DTUでは24.40 PSNRと0.77 SSIMを達成した(NeRFは3ビューで19.08 PSNRと0.59 SSIM)。
  • 深度整合性損失により、すべての視点方向にわたる整合性が強制され、幾何的アーティファクトが低減された。
  • ポーズが15%のガウスノイズで摑み直されても、SPARFは優れた性能を維持し、ポーズ不正確性に対するロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。