Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Implicit Dense Semantic SLAM

Yasaman Haghighi, Suryansh Kumar|arXiv (Cornell University)|2023. 04. 27.
Robotics and Sensor-Based Localization인용 수 6
한 줄 요약

이 논문은 ORB-SLAM 3의 추적 및 루프 클로징 기능을 Instant-NGP와 NeuS 기반의 신경 암시 맵핑 네트워크와 통합하여, 키프레임에서 밀도 높은 3D 기하학, RGB, 깊이, 세분화 정보를 온라인으로 메모리 효율적으로 학습할 수 있는 새로운 RGBD 시각 SLAM 시스템을 제안한다. 이 방법은 노이즈가 있거나 희박한 깊이 입력이 있는 상황에서도 25 m² 환경에서 1cm 이내의 깊이 정확도와 25 MB 이하의 메모리 사용량을 달성한다.

ABSTRACT

Visual Simultaneous Localization and Mapping (vSLAM) is a widely used technique in robotics and computer vision that enables a robot to create a map of an unfamiliar environment using a camera sensor while simultaneously tracking its position over time. In this paper, we propose a novel RGBD vSLAM algorithm that can learn a memory-efficient, dense 3D geometry, and semantic segmentation of an indoor scene in an online manner. Our pipeline combines classical 3D vision-based tracking and loop closing with neural fields-based mapping. The mapping network learns the SDF of the scene as well as RGB, depth, and semantic maps of any novel view using only a set of keyframes. Additionally, we extend our pipeline to large scenes by using multiple local mapping networks. Extensive experiments on well-known benchmark datasets confirm that our approach provides robust tracking, mapping, and semantic labeling even with noisy, sparse, or no input depth. Overall, our proposed algorithm can greatly enhance scene perception and assist with a range of robot control problems.

연구 동기 및 목표

  • 내부 환경의 기하학, RGB, 깊이, 세분화 정보를 포함한 밀도 높고 메모리 효율적인 3D 표현을 생성하는 견고하고 온라인 시각 SLAM 시스템을 개발하는 것.
  • 기존의 vSLAM(희박한 맵)과 신경 SLAM(루프 클로징 기능 없음, 드리프트 발생)의 한계를 극복하기 위해 고전적 추적 및 루프 클로징 기능을 신경 암시 맵핑과 통합하는 것.
  • 일관성 없거나 진동하는 애너테이션 조건에서도 키프레임에서의 2D 세분화 맵을 활용해 3D 공간에서 정확한 세분화를 수행할 수 있도록 하는 것.
  • 동적 키프레임 관리 기반의 하위공간별 로컬 맵핑 네트워크를 통해 대규모 환경으로의 확장성을 확보하는 것.
  • 노이즈가 많거나 희박하거나 깊이 정보가 없는 입력 조건에서도 견고한 성능을 보여주는 것.

제안 방법

  • 시스템은 기하학적 및 사진적 기준에 따라 키프레임을 선택함으로써 실시간 카메라 자세 추정 및 루프 클로징을 위해 ORB-SLAM 3를 사용한다.
  • Instant-NGP 기반으로 개선된 NeuS에서 확장된 신경 암시 맵핑 네트워크는 연속적인 3D 표현에서 서명 거리 함수(SDF), RGB, 깊이, 세분화 맵을 학습한다.
  • 동적으로 유지되는 키프레임 세트에 대해 사진적, 기하학적(SDF), 세분화 손실을 적용하여 맵핑 네트워크를 최적화한다.
  • 다중 스케일의 로컬 맵핑 전략은 전역 공간을 하위 영역으로 나누며, 각 하위 영역에 별도의 신경망을 적용하여 대규모 환경로의 확장성을 확보한다.
  • 추적 실패 상황을 처리하기 위해 암시적 신경 표현과 명시적 메시 재구성 간 전환을 허용하는 활성/비활성 메시 파라다임을 사용한다.
  • 2D 세분화 맵을 키프레임에서 유도한 세분화 지도를 3D 공간으로 투영하여 신경 필드의 세분화 헤드를 지도로 활용한다.

실험 결과

연구 질문

  • RQ1동적으로 유지되는 키프레임 세트만을 사용하여 신경 암시 맵핑 네트워크를 온라인으로 점진적으로 효과적으로 훈련시킬 수 있는가?
  • RQ23D 애너테이션 데이터가 필요 없이 키프레임의 2D 세분화 맵에서 밀도 높은 3D 세분화를 정확하게 학습시킬 수 있는가?
  • RQ3세분화 지도를 통합함으로써, 특히 평평하거나 무늬가 없는 영역에서 신경 암시 기하학 및 깊이 추정의 정확도가 향상되는가?
  • RQ4고전적 vSLAM(추적 및 루프 클로징)과 신경 암시 맵핑을 통합함으로써 드리프트를 줄이고 대규모 실내 환경에서 견고한 운영을 가능하게 할 수 있는가?
  • RQ5노이즈가 많거나 희박하거나 깊이 정보가 없는 입력 조건에서 시스템의 성능은 어떠한가?

주요 결과

  • 제안된 방법은 RGBD 입력 조건에서 Replica 데이터셋에서 평균 L1 깊이 오차 0.518 cm, office0 시퀀스에서 0.3336 cm를 기록하여 높은 기하학적 정확도를 확보했다.
  • RGB 전용 입력 조건에서도 office0 시퀀스에서 L1 깊이 오차 3.3 cm를 기록했으며, 이는 이전의 RGB 전용 방법들(예: NICE-SLAM의 11.12 cm)보다 유의미하게 낮아 세분화 지도의 이점이 뚜렷하다.
  • 세분화 지도를 추가함으로써 office0 시퀀스에서 깊이 오차가 RGBD 전용 조건의 0.46 cm에서 0.31 cm로 감소하여, 세분화 정보가 기하학적 재구성 향상에 기여함을 확인했다.
  • 25 m² 환경에서 시스템은 25 MB 이하의 작고 효율적인 메모리 프로파일을 유지하여 저장 및 추론에 있어 뛰어난 효율성을 확보했다.
  • 제거 실험을 통해 세분화 지도가 훈련을 안정화시키고, 특히 평평하거나 무늬가 적은 영역에서 기하학적 학습을 향상시킴을 확인했으며, 정성적 비교를 통해 이를 입증했다.
  • office0 시퀀스에서 PSNR 40.23 dB, SSIM 0.993를 기록하여 복잡한 실내 환경에서도 높은 품질의 색상 및 기하학적 재구성 성능을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.