Skip to main content
QUICK REVIEW

[論文レビュー] Dense Depth Priors for Neural Radiance Fields from Sparse Input Views

Barbara Roessle, Jonathan T. Barron|arXiv (Cornell University)|Dec 6, 2021
Advanced Vision and Imaging被引用数 16
ひとこと要約

本稿では、スパースSfM再構成から得られる密集した深度事前知識を活用することで、18〜36枚の入力画像のみで、ルームスケールのシーンにおけるニューラルレンダリングフィールド(NeRF)のビュー合成をデータ効率的に実現する手法を提案する。この手法は、スパース深度を精度向上させるための深度補完ネットワークを用い、不確実性推定を併用することで、ベースラインのNeRFやスパース深度のみを用いる手法よりも、より高品質な新規ビューと正確な深度マップを生成するNeRF最適化を実現する。

ABSTRACT

Neural radiance fields (NeRF) encode a scene into a neural representation that enables photo-realistic rendering of novel views. However, a successful reconstruction from RGB images requires a large number of input views taken under static conditions - typically up to a few hundred images for room-size scenes. Our method aims to synthesize novel views of whole rooms from an order of magnitude fewer images. To this end, we leverage dense depth priors in order to constrain the NeRF optimization. First, we take advantage of the sparse depth data that is freely available from the structure from motion (SfM) preprocessing step used to estimate camera poses. Second, we use depth completion to convert these sparse points into dense depth maps and uncertainty estimates, which are used to guide NeRF optimization. Our method enables data-efficient novel view synthesis on challenging indoor scenes, using as few as 18 images for an entire scene.

研究の動機と目的

  • 標準NeRFが要する入力画像数よりも著しく少ない画像数で、ルームスケールシーンにおける高精細な新規ビュー合成を可能にすること。
  • テクスチャが欠落した領域、視野の重複が少ない領域、色の不一致を引き起こす室内シーンの課題がNeRFの性能を低下させることを緩和すること。
  • 追加の深度センサーを必要とせず、スパースSfM再構成から得られる密集した深度事前知識を活用してNeRF最適化を向上させること。
  • 不確実性推定を深度事前知識に組み込むことで、曖昧または視認性が低い領域におけるNeRF最適化をより頑健にすること。
  • 大規模な入力ビュー数に依存することを減らしながらも、新規ビュー合成における幾何的・光度的整合性を維持すること。

提案手法

  • カメラポーズ推定の副産物として得られるスパース深度点を、入力画像のための深度事前知識として利用する。
  • スパースSfM深度点を、ピxls単位の不確実性推定値を伴う密集した深度マップに変換するための深度補完ネットワークを採用する。
  • 密集した深度マップとその不確実性を、NeRF最適化における監視信号として統合し、シーンの幾何構造と外観を正則化する。
  • 深度監視に微分可能なガウスノイズ損失(GNLL)を適用し、密度および深度予測のシャープネスを向上させる。
  • 各カメラごとに潜在コードを導入し、視点依存の効果をモデル化し、新規ビュー間での色の整合性を確保する。
  • RGB再構成、不確実性重み付き深度監視、深度整合性のためのGNLLを組み合わせたマルチタスク損失を用いてNeRFを最適化する。

実験結果

リサーチクエスチョン

  • RQ1スパースSfM再構成から得られる密集した深度事前知識は、画像数が少ない状況下でもNeRFの性能を著しく向上させることができるか?
  • RQ2不確実性を考慮した深度監視は、テクスチャが欠落した領域や観測が不十分な領域におけるNeRF最適化にどのように影響するか?
  • RQ3深度補完ネットワークは、多様な室内シーンに一般化して適用可能であり、データ効率的なNeRF学習を支援できるか?
  • RQ4深度事前知識に不確実性を組み込むことで、NeRF出力におけるアーティファクト(例:「フローター」や色の不一致)が軽減されるか?
  • RQ51つの事前学習済み深度事前知識ネットワークを用いることで、最小限の入力画像数で複数のルームスケールシーンにおいて高品質なビュー合成が可能になるか?

主な発見

  • 提案手法は、18〜36枚の入力画像のみで、ScanNetではPSNRが20.96、Matterport3Dでは18.33を達成し、標準NeRFを著しく上回る性能を示した。
  • 深度補完を省略した場合、ScanNetにおけるPSNRは20.09に低下し、密集した深度事前知識が性能向上に不可欠であることが示された。
  • 不確実性監視を削除すると、エッジエラーと重複の明らかなアーティファクトが発生し、ScanNetにおけるRMSEは0.308に上昇した。
  • 深度損失にMSEをGNLLに置き換えた場合、特に接線方向のビューにおいて密度分布がぼやけ、ScanNetにおけるRMSEは0.312に上昇した。
  • 潜在コードを除外した場合、視点間で色のずれや明るさの不一致が生じ、ScanNetにおけるRMSEは0.293に上昇した。
  • アブレーションスタディの結果、補完、不確実性、GNLL、潜在コードの各モジュールが、画像品質および深度精度の向上に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。