Skip to main content
QUICK REVIEW

[論文レビュー] Structure-Aware NeRF without Posed Camera via Epipolar Constraint

Shu Chen, Yang Zhang|arXiv (Cornell University)|Oct 1, 2022
Advanced Vision and Imaging被引用数 5
ひとこと要約

本稿では、事前に既知のポーズを必要とせずに、神経放射場とカメラ外部パラメータを共同で最適化する構造に配慮したNeRF手法、SaNeRFを提案する。視点間のSIFT特徴点対応にエピポーラ制約を課すことにより、視点再構築品質およびカメラポーズ推定精度の両方を向上させるエンドツーエンド学習が可能となり、ScanNetおよびLLFF-NeRFデータセットで最先端の結果を達成した。

ABSTRACT

The neural radiance field (NeRF) for realistic novel view synthesis requires camera poses to be pre-acquired by a structure-from-motion (SfM) approach. This two-stage strategy is not convenient to use and degrades the performance because the error in the pose extraction can propagate to the view synthesis. We integrate the pose extraction and view synthesis into a single end-to-end procedure so they can benefit from each other. For training NeRF models, only RGB images are given, without pre-known camera poses. The camera poses are obtained by the epipolar constraint in which the identical feature in different views has the same world coordinates transformed from the local camera coordinates according to the extracted poses. The epipolar constraint is jointly optimized with pixel color constraint. The poses are represented by a CNN-based deep network, whose input is the related frames. This joint optimization enables NeRF to be aware of the scene's structure that has an improved generalization performance. Extensive experiments on a variety of scenes demonstrate the effectiveness of the proposed approach. Code is available at https://github.com/XTU-PR-LAB/SaNerf.

研究の動機と目的

  • NeRFベースの新規視点再構築における事前計算されたカメラポーズへの依存を排除すること。
  • 幾何的制約を通じたシーン構造の認識を統合することで、NeRFの一般化性能を向上させること。
  • RGB画像のみを用いて、NeRFとカメラポーズ推定をエンドツーエンドで最適化すること。
  • 従来の2段階NeRFパイプラインにおける不正確なSfMポーズ推定による誤差伝搬を低減すること。
  • 光度的一致性とエピポーラ幾何学を用いて、自己教師付きでロバストな3次元再構築を実現すること。

提案手法

  • 本手法はSIFT特徴抽出を用いて、画像ペア間の対応点を特定する。
  • 対応するSIFT特徴点がグローバル空間内で同一の3次元座標を持つように、エピポーラ制約を課す。
  • 関連する画像フレームを入力として、CNNを用いてカメラ外部パラメータを予測する。
  • エピポーラ制約を、ピixe ル色再構成損失と共同でエンドツーエンド学習中に最適化する。
  • SIFT特徴点のグローバル3次元座標は、推定された外部パラメータを用いて局所カメラ座標系から変換することで計算する。
  • システム全体をエンドツーエンドで学習することで、シーン表現とカメラポーズ推定の相互改善を可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前に既知のカメラポーズに依存せずに、NeRFは正確な新規視点再構築を達成できるか?
  • RQ2SIFT対応点にエピポーラ制約を課すことで、NeRFの一般化性能と構造認識能力が向上するか?
  • RQ3NeRFとカメラポーズの共同最適化は、SfMベースのパイプラインにおける分離最適化よりも優れた性能を発揮するか?
  • RQ4SIFT対応が失敗するようなスパarsな領域やテクスチャのない領域を含むシーンでは、この手法はどのように動作するか?
  • RQ5初期化がランダムであっても、このアプローチは正確なカメラ軌道に収束するか?

主な発見

  • ScanNetデータセットのシーン0553ではPSNRが33.69、シーン0158では33.12を達成し、NeRFおよび他のベースラインを上回った。
  • LLFF-NeRFデータセットでは、'Flower'シーンのATE(絶対軌道誤差)が0.000788にまで低下し、NeRF-のベースライン0.011を著しく下回った。
  • 約100,000エポックの学習後、COLMAPで得られた軌道に近づくカメラポーズ推定の収束を示し、安定した最適化を確認した。
  • 十分なSIFT対応点が存在するシーン(例:シーン0079、0158、0553)では、PSNRおよびSSIMの両面で最先端の性能を達成した。
  • 繰り返し構造(例:シーン0316)やテクスチャのない領域では手法が失敗し、光度的曖昧性下での制限が明らかになった。
  • 共同最適化戦略により相互改善が実現:より良いポーズ推定が高品質な視点再構築を、逆に高品質な視点再構築がより良いポーズ推定をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。