Skip to main content
QUICK REVIEW

[論文レビュー] NoPe-NeRF: Optimising Neural Radiance Field with No Pose Prior

Wenjing Bian, Zirui Wang|arXiv (Cornell University)|Dec 14, 2022
Advanced Vision and Imaging被引用数 7
ひとこと要約

NoPe-NeRFは、未校正の単眼深度事前知識を用いて、一括で微分可能な手法としてNeural Radiance Fieldsとカメラポーズの最適化を同時に行う。大規模なカメラ運動下でもポーズ推定を安定化させるために、歪みのない単眼深度事前知識を活用する。深度マップのスケールおよびシフトパラメータを明示的に最適化し、フレーム間のチェンバーディスタンスと表面ベースの光度損失を導入することで、実世界の屋内および屋外シーケンスにおいて、最先端のベースラインと比較して優れた新規ビュー合成とポーズ精度を達成する。

ABSTRACT

Training a Neural Radiance Field (NeRF) without pre-computed camera poses is challenging. Recent advances in this direction demonstrate the possibility of jointly optimising a NeRF and camera poses in forward-facing scenes. However, these methods still face difficulties during dramatic camera movement. We tackle this challenging problem by incorporating undistorted monocular depth priors. These priors are generated by correcting scale and shift parameters during training, with which we are then able to constrain the relative poses between consecutive frames. This constraint is achieved using our proposed novel loss functions. Experiments on real-world indoor and outdoor scenes show that our method can handle challenging camera trajectories and outperforms existing methods in terms of novel view rendering quality and pose estimation accuracy. Our project page is https://nope-nerf.active.vision.

研究の動機と目的

  • 事前に計算されたカメラポーズが存在しない状況、特に大規模または動的なカメラ運動下でのNeRF学習の課題に対処すること。
  • 未校正NeRF学習における形状-放射場の曖昧さと相対的ポーズ制約の欠如によって引き起こされる不安定性と収束遅延を克服すること。
  • NeRF最適化パイプラインに単眼深度事前知識を統合することで、ポーズ推定精度と新規ビュー合成品質を向上させること。
  • SfMやSLAMパイプラインへの依存を排除し、生のRGBシーケンスからNeRFとカメラポーズを一括で微分可能な形で最適化すること。

提案手法

  • NeRF学習中に、各単眼深度マップのスケールおよびシフトパラメータを明示的に最適化することで、歪みを補正し、マルチビュー整合性を持つ深度マップを生成する。
  • 隣接フレーム間の深度マップの間でチェンバーディスタンスに基づく損失を導入し、最適化に相対的ポーズ制約を組み込む。
  • NeRF表面での光度的一致性を強制する、深度に基づく表面レンダリング損失を適用し、さらにポーズ推定を正則化する。
  • これらの新規損失を標準的なNeRFレンダリング損失と組み合わせ、ニューラル放射場とカメラポーズを一括で微分可能な形で同時に最適化する。
  • 軽量な単眼深度推定を幾何学的事前知識として活用し、マルチビューステレオやカメラパラメータ入力の必要性を回避する。

実験結果

リサーチクエスチョン

  • RQ1カメラポーズが事前に入手できない状況下でも、単眼深度事前知識を効果的にNeRF学習の安定化に活用できるか?
  • RQ2NeRF最適化中に、生の単眼深度予測から歪みのないマルチビュー整合性を持つ深度マップをどのように生成できるか?
  • RQ3フレーム間の相対的ポーズ制約は、大規模なカメラ運動下でのNeRFとポーズの同時最適化の精度と耐性をどの程度向上できるか?
  • RQ4標準的なNeRF学習と比較して、深度に基づく表面レンダリング損失を統合することで、ポーズ推定と新規ビュー合成の品質が向上するか?

主な発見

  • NoPe-NeRFは、ScanNetでは平均PSNRが31.86、Tanks and Templesでは26.73を達成し、COLMAP+NeRFや他の最先端手法を上回る新規ビュー合成品質を実現した。
  • ScanNetでは、平均相対ポーズ誤差(RPE)をトランスレーションで0.181、回転で0.031まで低減し、ベースラインと比較して顕著にポーズ精度が向上した。
  • アブレーションスタディの結果、スケール/シフト最適化を除去するとRPEが2倍以上に増加し、深度歪み補正の重要性が明確に示された。
  • フレーム間のチェンバーディスタンス損失($L_{pc}$)と表面光度損失($L_{rgb-s}$)が、ポーズ推定の向上を主に駆動しており、これらの損失を除去するとRPEが2倍以上に増加した。
  • 1段階のNoPe-NeRF手法は、2段階のOurs-rバージョンを上回り、深度事前知識を用いた一括最適化が、逐次的精錬よりも効果的であることを示した。
  • 低テクスチャで回転が支配的な運動を示す困難なシーケンスにおいて、NoPe-NeRFはCOLMAPの失敗モードを回避し、アーチファクトのない新規ビューを生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。