Skip to main content
QUICK REVIEW

[논문 리뷰] NeRF-SLAM: Real-Time Dense Monocular SLAM with Neural Radiance Fields

Antoni Rosinol, John J. Leonard|arXiv (Cornell University)|2022. 10. 24.
Advanced Vision and Imaging인용 수 6
한 줄 요약

NeRF-SLAM은 실시간으로 동작하는 단안 SLAM 파이프라인을 제안하며, 밀도 높은 깊이 맵과 밀도 높은 단안 SLAM 시스템에서 유도된 불확실성 추정치를 활용해 실시간으로 계층적인 부피형 신경 렌디언스 필드(NeRF)를 훈련한다. 깊이 예측값을 그들의 경계 분산으로 가중치를 적용함으로써, 이 방법은 기존의 접근 방식보다 최상의 사진적 정확도와 기하학적 정확도를 달성한다—PSNR는 최대 179% 향상되고, L1 깊이 오차는 86% 향상된다. 이는 표준 GPU 하드웨어에서 10–12 FPS로 구동된다.

ABSTRACT

We propose a novel geometric and photometric 3D mapping pipeline for accurate and real-time scene reconstruction from monocular images. To achieve this, we leverage recent advances in dense monocular SLAM and real-time hierarchical volumetric neural radiance fields. Our insight is that dense monocular SLAM provides the right information to fit a neural radiance field of the scene in real-time, by providing accurate pose estimates and depth-maps with associated uncertainty. With our proposed uncertainty-based depth loss, we achieve not only good photometric accuracy, but also great geometric accuracy. In fact, our proposed pipeline achieves better geometric and photometric accuracy than competing approaches (up to 179% better PSNR and 86% better L1 depth), while working in real-time and using only monocular images.

연구 동기 및 목표

  • 지정된 깊이 측정값이 없는 단안 RGB 영상에서 실시간으로 정확한 3D 장면 재구성을 해결하는 데 목적이 있다.
  • 정확한 자세 정보와 깊이 측정값이 필요로 하며, 가상 기하학적 왜곡과 느린 수렴 속도 문제를 겪는 전통적인 NeRF의 한계를 극복하는 데 목적이 있다.
  • 밀도 높은 단안 SLAM과 계층적인 부피형 NeRF를 통합하여 단안 입력만으로도 실시간으로 메트릭 기반 정확한 3D 매핑을 가능하게 하는 데 목적이 있다.
  • NeRF 최적화 과정에서 불확실성 인식 깊이 감독을 활용해 기하학적 및 사진적 정확도를 향상시키는 데 목적이 있다.
  • 불확실성 가중 깊이 사전 지식이 노이즈가 있거나 정밀도가 떨어지는 깊이 추정치가 존재하는 상황에서도 NeRF 수렴과 강건성을 크게 향상시킨다는 것을 입증하는 데 목적이 있다.

제안 방법

  • 실시간으로 카메라 자세와 관련된 경계 분산(불확실성 추정치 포함)이 있는 밀도 높은 단안 SLAM 시스템을 활용하여 밀도 높은 깊이 맵을 추정한다.
  • NeRF 최적화 과정에서 새로운 불확실성 기반 깊이 손실을 적용하며, 깊이 예측값을 그들의 불확실성으로 가중치를 적용함으로써 편향을 줄이고 수렴을 향상시킨다.
  • SLAM 출력 결과를 감독으로 사용하여 계층적 해시 기반 부피형 신경 렌디언스 필드를 훈련시켜 RGB 이미지 스트림에서 실시간 추론을 가능하게 한다.
  • 트래킹 및 매핑 스레드를 병렬화하며, 트래킹 스레드는 약 15 FPS, 매핑 스레드는 약 10 FPS로 운영되어 총 10 FPS에서 실시간 성능을 달성한다.
  • 관련성 볼륨 계산과 부피 렌더링을 가속화하기 위해 고유의 CUDA 커널을 구현하여 메모리 및 계산 병목 현상을 줄인다.
  • 정확도와 계산 부담을 균형 있게 유지하기 위해 광학 흐름 크기(2.5 픽셀 이상) 기반의 关键 프레임 선택 전략을 구현한다.
Figure 1 : From left to right, input RGB image, estimated depth uncertainty, back-projected depth-maps into a pointcloud, after thresholding the depth by its uncertainty ( $\sigma_{d}\leq 1.0$ ) for visualization, and our resulting neural radiance field, rendered from the same viewpoint as the input
Figure 1 : From left to right, input RGB image, estimated depth uncertainty, back-projected depth-maps into a pointcloud, after thresholding the depth by its uncertainty ( $\sigma_{d}\leq 1.0$ ) for visualization, and our resulting neural radiance field, rendered from the same viewpoint as the input

실험 결과

연구 질문

  • RQ1밀도 높은 단안 SLAM이 지정된 자세나 깊이 측정값이 없는 실시간 정확한 NeRF 재구성에 충분한 기하학적 및 사진적 사전 지식을 제공할 수 있는가?
  • RQ2불확실성 가중 깊이 감독은 무게 없이 또는 깊이 감독 없이 비교할 때 신경 렌디언스 필드의 수렴과 정확도를 어떻게 향상시키는가?
  • RQ3단안 SLAM 출력에서 유도된 NeRF가 기존의 단안 재구성 방법에 비해 얼마나 우수한 사진적 및 기하학적 정확도를 달성할 수 있는가?
  • RQ4노이즈가 있거나 불확실한 깊이 추정치가 NeRF 최적화에 미치는 영향은 무엇이며, 불확실성 가중치는 이러한 영향을 완화시킬 수 있는가?
  • RQ5RGB-D나 스테레오 센서 없이 단안 RGB 입력만으로 실시간 NeRF 재구성을 달성하는 것은 가능한가?

주요 결과

  • NeRF-SLAM은 Replica 데이터셋에서 경쟁하는 단안 접근 방식 대비 최대 179% 향상된 PSNR를 기록하여 사진적 정확도가 뛰어나다는 것을 입증한다.
  • 최신 기술 대비 L1 깊이 오차를 86% 감소시켜 기하학적 정확도 향상의 뚜렷한 성과를 보였다.
  • 불확실성 가중 깊이 사전 지식을 사용할 경우, 무게 없는 깊이 또는 깊이 없음 기반 베이스라인 대비 PSNR 저하와 깊이 편향이 감소하여 더 빠르고 강건한 NeRF 수렴이 이루어진다.
  • 표준 GPU 하드웨어(640×480 해상도)에서 10–12 FPS로 구동되어 트래킹 및 매핑 스레드를 병렬화함으로써 실시간 성능을 달성한다.
  • 노이즈가 있는 자세나 깊이 추정치가 존재하는 상황에서도 깊이의 경계 분산으로 가중치를 적용함으로써 높은 정확도를 유지하며, 무게 없는 깊이 또는 깊이 없음 기반 베이스라인을 모두 능가한다.
  • 지정된 자세나 깊이 측정값이 필요 없이, 단지 SLAM 시스템의 불확실성 인식 출력 결과만으로도 감독을 받는다.
Figure 2 : The input to our pipeline consists of sequential monocular images (here represented as Img 1 & Img 2). Starting from the top-right, our architecture fits a NeRF using Instant-NGP [ 17 ] , which we supervise using RGB images $\mathbf{I}$ , depths $\mathbf{D}$ , where the depths are weighte
Figure 2 : The input to our pipeline consists of sequential monocular images (here represented as Img 1 & Img 2). Starting from the top-right, our architecture fits a NeRF using Instant-NGP [ 17 ] , which we supervise using RGB images $\mathbf{I}$ , depths $\mathbf{D}$ , where the depths are weighte

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.