[논문 리뷰] ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes
ProSGNeRF는 주로 빠르게 움직이는 차량과 희박한 시야를 가진 대규모 도시 환경에서 고해상도 신시각 합성 구현을 위해 주파수 조절형 오토에인코더를 갖춘 점진적 동적 신경 장면 그래프를 제안한다. 시간 창에 걸쳐 동적으로 로컬 장면 그래프를 할당하고 주파수 인식 잠재 인코딩을 사용함으로써, KITTI 및 VKITTI 데이터셋에서 시각 합성, 물체 조작, 장면 이동 등에서 최신 기술 수준의 성능을 달성한다.
Implicit neural representation has demonstrated promising results in 3D reconstruction on various scenes. However, existing approaches either struggle to model fast-moving objects or are incapable of handling large-scale camera ego-motions in urban environments. This leads to low-quality synthesized views of the large-scale urban scenes. In this paper, we aim to jointly solve the problems caused by large-scale scenes and fast-moving vehicles, which are more practical and challenging. To this end, we propose a progressive scene graph network architecture to learn the local scene representations of dynamic objects and global urban scenes. The progressive learning architecture dynamically allocates a new local scene graph trained on frames within a temporal window, with the window size automatically determined, allowing us to scale up the representation to arbitrarily large scenes. Besides, according to our observations, the training views of dynamic objects are relatively sparse according to rapid movements, which leads to a significant decline in reconstruction accuracy for dynamic objects. Therefore, we utilize a foundation model network to encode the latent code. Specifically, we leverage the generalization capability of the visual foundation model DINOv2 to extract appearance and shape codes, and train the network on a large-scale urban scene object dataset to enhance its prior modeling ability for handling sparse-view dynamic inputs. In parallel, we introduce a frequency-modulated module that regularizes the frequency spectrum of objects, thereby addressing the challenge of modeling sparse image inputs from a frequency-domain perspective. Experimental results demonstrate that our method achieves state-of-the-art view synthesis accuracy, object manipulation, and scene roaming ability in various scenes.
연구 동기 및 목표
- 대규모 도시 환경에서 다수의 빠르게 움직이는 물체와 상당한 카메라 자가 운동이 존재하는 상황에서의 시각 합성 문제를 해결하기 위해.
- 실제 도시 데이터셋에서 흔히 발생하는 희박한 시야 관측 조건에서 동적 물체의 재구성 정확도를 향상시키기 위해.
- 자동으로 물체 및 원거리 영역 마스크를 생성하기 위해 프롬프트 기반 세분화(SAM 등)를 활용함으로써 인간의 수작업 마스크 생성 의존도를 줄이기 위해.
- LiDAR 포인트 클라우드 투영을 통한 감독을 통해 대규모 장면에서 기하학적 일致성을 유지하기 위해.
- 관측된 학습 데이터가 이러한 구성에 해당하지 않더라도, 물체 조작 및 새로운 장면 그래프 구성과 같은 탄력적인 장면 편집을 가능하게 하기 위해.
제안 방법
- 이 방법은 배경, 동적 물체, 원거리 영역으로 장면를 분해하고, 각 구성 요소에 전용 신경망을 사용해 표현을 구현한다.
- 점진적 기법을 통해 시간 창에 걸쳐 로컬 장면 그래프를 동적으로 생성하고 유지함으로써, 임의로 큰 장면에 대한 확장성을 확보한다.
- 형태 및 외관 특징를 동적 물체에서 인코딩하고, 희박한 시야 입력 조건에서 잠재 표현을 정규화하기 위해 주파수 조절을 수행하는 오토에인코더 네트워크를 사용한다.
- 시스템은 동적 물체 및 원거리 영역에 대해 정확한 마스크를 생성하기 위해 세분화 무결성 모델(SAM)을 사용하여 제로샷 프롬프트 기반 인스턴스 세분화를 수행함으로써, 마스크 생성의 부담을 감소시킨다.
- LiDAR 포인트 클라우드 투영을 통해 기하학적 일致성에 대한 감독을 수행하여, 대규모 도시 환경에서 정확한 공간 정렬을 보장한다.
- 다중 구성 요소 손실 함수는 깊이 손실과 KL 발산 손실을 포함하여 기하학적 정확도 향상과 잠재 공간 정규화를 개선한다.
실험 결과
연구 질문
- RQ1점진적 신경 장면 그래프 아키텍처는 복잡한 카메라 자가 운동과 다수의 동적 물체를 포함한 대규모 도시 환경에 효과적으로 확장될 수 있는가?
- RQ2희박한 시야 관측 조건에서 동적 도시 물체의 암묵적 신경 표현은 어떻게 향상시킬 수 있는가?
- RQ3SAM과 같은 프롬프트 기반 세분화 모델은 동적 장면 재구성에서 수작업 마스크 생성의 필요성을 어느 정도 줄일 수 있는가?
- RQ4희박한 훈련 시야 조건에서 잠재 공간 내 주파수 조절이 동적 물체 표현 향상에 기여하는가?
- RQ5제안된 방법은 학습 데이터에 포함되지 않은 새로운 물체 자세 조작 및 장면 그래프 구성과 같은 탄력적인 장면 편집을 지원할 수 있는가?
주요 결과
- ProSGNeRF 전체 모델은 KITTI 트래킹 0006 시퀀스에서 PSNR 30.31, SSIM 0.891, LPIPS 0.055를 기록하여 기존 방법들을 능가한다.
- 진행적 장면 그래프를 제거할 경우 PSNR가 27.21로 크게 감소하여, 대규모 자가 운동 처리에 있어 이 구조의 핵심적 역할을 확인한다.
- 기본 MLP로 주파수 오토에인코더를 대체할 경우 PSNR가 28.32로 감소하여, 희박한 시야에서 동적 물체를 효과적으로 처리하는 데 주파수 조절의 유용성을 입증한다.
- 깊이 손실 또는 KL 발산 손실을 생략할 경우 성능이 저하되며(각각 PSNR 28.93 및 29.45), 이는 기하학적 정확도 확보에 있어 이 손실 항목의 중요성을 보여준다.
- 학습 중에 관측되지 않은 물체 배치 및 회전에 대한 새로운 시각 합성을 가능하게 하여, 강력한 일반화 및 편집 능력을 입증한다.
- VKITTI 데이터셋에서 ProSGNeRF는 최신 기술 수준의 이미지 재구성 정확도를 달성하여, PSNR 0.372, LPIPS 0.088를 기록하며 동시대의 다른 방법들을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.