Skip to main content
QUICK REVIEW

[論文レビュー] ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

Tianchen Deng, Wang, Yanbo|arXiv (Cornell University)|Dec 14, 2023
Advanced Vision and Imaging被引用数 7
ひとこと要約

ProSGNeRFは、周波数変調型オートエンコーダを用いた段階的動的ニューラルシーングラフを提案し、スパースな視点と高速移動する車両を伴う大規模都市シーンにおいて高精細な新規視点合成を実現する。時間窓にわたり動的にローカルシーングラフを割り当て、周波数に敏感な潜在符号化を用いることで、KITTIおよびVKITTIデータセットにおいて視点合成、オブジェクト操作、シーンローミングの分野で最先端の性能を達成する。

ABSTRACT

Implicit neural representation has demonstrated promising results in 3D reconstruction on various scenes. However, existing approaches either struggle to model fast-moving objects or are incapable of handling large-scale camera ego-motions in urban environments. This leads to low-quality synthesized views of the large-scale urban scenes. In this paper, we aim to jointly solve the problems caused by large-scale scenes and fast-moving vehicles, which are more practical and challenging. To this end, we propose a progressive scene graph network architecture to learn the local scene representations of dynamic objects and global urban scenes. The progressive learning architecture dynamically allocates a new local scene graph trained on frames within a temporal window, with the window size automatically determined, allowing us to scale up the representation to arbitrarily large scenes. Besides, according to our observations, the training views of dynamic objects are relatively sparse according to rapid movements, which leads to a significant decline in reconstruction accuracy for dynamic objects. Therefore, we utilize a foundation model network to encode the latent code. Specifically, we leverage the generalization capability of the visual foundation model DINOv2 to extract appearance and shape codes, and train the network on a large-scale urban scene object dataset to enhance its prior modeling ability for handling sparse-view dynamic inputs. In parallel, we introduce a frequency-modulated module that regularizes the frequency spectrum of objects, thereby addressing the challenge of modeling sparse image inputs from a frequency-domain perspective. Experimental results demonstrate that our method achieves state-of-the-art view synthesis accuracy, object manipulation, and scene roaming ability in various scenes.

研究の動機と目的

  • 大規模都市シーンに複数の高速移動する物体と顕著なカメラ自己運動が伴う状況における視点合成の課題に対処すること。
  • 実世界の都市データセットに一般的に見られるスパースな視点観測下での動的オブジェクトの再構築精度を向上させること。
  • プロンプト駆動型セグメンテーション(例:SAM)を活用してオートマチックにオブジェクトおよび遠距離領域のマスクを生成することで、人為的アノテーションマスクへの依存度を低減すること。
  • LiDAR点群の投影を用いた監督により、大規模シーンにおける幾何的整合性を維持すること。
  • 観測されたトレーニングデータが存在しない設定に対しても、オブジェクト操作や新規シーングラフ構築を含む柔軟なシーン編集を可能にすること。

提案手法

  • 本手法は、背景、動的オブジェクト、遠距離成分に分解するニューラルシーングラフを採用し、それぞれに専用のニューラルネットワークを割り当てて表現を実現する。
  • 段階的スキームにより、時間窓にわたり動的にローカルシーングラフを生成・維持することで、任意に大きなシーンへのスケーラビリティを実現する。
  • 周波数オートエンコーダネットワークが動的オブジェクトの形状および外観特徴を符号化し、スパースな視点入力下での潜在表現の正則化を周波数変調によって実現する。
  • システムは、ゼロショットでプロンプト駆動型のインスタンスセグメンテーションを実現するSegment Anything Model (SAM) を用い、動的オブジェクトおよび遠距離領域の正確なマスクを生成することで、アノテーション負荷を低減する。
  • LiDAR点群の投影を用いて幾何的整合性を監督し、大規模都市シーンにおける正確な空間アライメントを保証する。
  • 多成分損失関数には、深度損失およびKLダイバージェンス損失を含め、幾何的正確性と潜在空間の正則化を向上させる。

実験結果

リサーチクエスチョン

  • RQ1段階的ニューラルシーングラフアーキテクチャは、複雑なカメラ自己運動と複数の動的オブジェクトを伴う大規模都市シーンに効果的にスケーリング可能か?
  • RQ2スパースな視点観測下で、動的都市オブジェクトの暗黙的ニューラル表現をどのように向上できるか?
  • RQ3SAMのようなプロンプト駆動型セグメンテーションモデルは、動的シーン再構築における手作業アノテーションの必要性をどの程度低減できるか?
  • RQ4潜在空間における周波数変調は、限られたトレーニングビューでの動的オブジェクト表現を向上させるか?
  • RQ5提案手法は、トレーニングデータにない配置や回転を伴う新規オブジェクトポーズ操作やシーングラフ構築を含む柔軟なシーン編集を可能にするか?

主な発見

  • ProSGNeRFの完全モデルは、KITTIトラッキング0006シーケンスにおいてPSNR 30.31、SSIM 0.891、LPIPS 0.055を達成し、先行手法を上回る性能を示した。
  • プログレッシブシーングラフを削除するとPSNRが著しく低下(27.21)し、大規模な自己運動に対処する上でその重要性が明確になった。
  • 標準的なMLPに周波数オートエンコーダを置き換えるとPSNRは28.32に低下し、スパースな視点下での動的オブジェクト処理における有効性が裏付けられた。
  • 深度損失またはKLダイバージェンス損失を省略すると性能が劣化(PSNR 28.93および29.45)し、幾何的正確性の向上に寄与していることが示された。
  • 本手法は、トレーニング時に観測されていなかったオブジェクトの配置や回転を伴う新規視点合成を可能にし、優れた一般化能力と編集能力を示した。
  • VKITTIデータセットにおいても、ProSGNeRFは最先端の画像再構築精度を達成し、PSNR 0.372、LPIPS 0.088を記録し、同時期の手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。