[논문 리뷰] PLGSLAM: Progressive Neural Scene Represenation with Local to Global Bundle Adjustment
PLGSLAM은 대규모 실내 환경에서 고해상도 재구성과 견고한 카메라 추적을 위한 동적 국소 장면 표현(삼중 평면 및 MLP 포함)을 사용하는 점진적 신경 SLAM 시스템을 제안한다. 누적 자세 오차를 완화하기 위해 전역 关键 프레임 데이터베이스를 활용한 국소-전역 버블 조정을 도입하여 소규모 및 대규모 데이터셋에서 재구성 정확도와 추적 견고성 측면에서 최신 기술 수준의 성능을 달성한다.
Neural implicit scene representations have recently shown encouraging results in dense visual SLAM. However, existing methods produce low-quality scene reconstruction and low-accuracy localization performance when scaling up to large indoor scenes and long sequences. These limitations are mainly due to their single, global radiance field with finite capacity, which does not adapt to large scenarios. Their end-to-end pose networks are also not robust enough with the growth of cumulative errors in large scenes. To this end, we introduce PLGSLAM, a neural visual SLAM system capable of high-fidelity surface reconstruction and robust camera tracking in real-time. To handle large-scale indoor scenes, PLGSLAM proposes a progressive scene representation method which dynamically allocates new local scene representation trained with frames within a local sliding window. This allows us to scale up to larger indoor scenes and improves robustness (even under pose drifts). In local scene representation, PLGSLAM utilizes tri-planes for local high-frequency features with multi-layer perceptron (MLP) networks for the low-frequency feature, achieving smoothness and scene completion in unobserved areas. Moreover, we propose local-to-global bundle adjustment method with a global keyframe database to address the increased pose drifts on long sequences. Experimental results demonstrate that PLGSLAM achieves state-of-the-art scene reconstruction results and tracking performance across various datasets and scenarios (both in small and large-scale indoor environments). The code is open-sourced at https://github.com/dtc111111/plgslam.
연구 동기 및 목표
- 장기적인 시퀀스 동안 누적 자세 오차가 발생하고 전역 반사율 필드의 용량이 유한하기 때문에 기존 신경 SLAM 시스템이 대규모 실내 환경에서 성능에 한계를 가짐을 해결한다.
- 카메라가 이동함에 따라 슬라이딩 윈도우 내에서 국소 장면 표현을 동적으로 할당하여 장면 표현의 확장성과 견고성을 향상시킨다.
- 고주파 특징을 위한 삼중 평면과 저주파 일관성 및 장면 보완을 위한 MLP를 조합하여 재구성 정확도와 부드러움을 향상시킨다.
- 모든 이력 关键 프레임을 활용한 최적화를 통해 장기 시퀀스에서 누적 자세 오차를 감소시키기 위해 국소-전역 버블 조정 전략을 도입한다.
- 소규모 실내 공간과 대규모 다실 환경 모두에서 높은 정확도를 유지하면서 실시간 성능을 달성한다.
제안 방법
- 카메라가 현재 국소 영역의 경계에 가까워지면 새로운 국소 장면 표현을 동적으로 초기화하여 대규모 장면의 스케일러블 모델링을 가능하게 한다.
- 24cm 및 6cm 해상도와 32채널 특징 맵을 사용한 삼중 평면을 활용해 국소 고주파 기하학적 구조와 질감 세부 정보를 인코딩한다.
- 두 층의 MLP(32개의 은닉 유닛)를 사용해 삼중 평면 특징과 조합하여 저주파 전역 특징, 부드러움, 관측되지 않은 영역 보완을 모델링한다.
- 모든 이전 관측치를 저장하고 모든 이력 프레임 간의 재투영 오차 최소화를 가능하게 하기 위해 전역 关键 프레임 데이터베이스를 유지한다.
- 국소 및 전역 关键 프레임을 사용해 국소 표현에서 파생된 레이를 전역 좌표계로 변형함으로써 국소-전역 버블 조정을 수행한다.
- 특징 유사도, SDF 일관성, 부드러움, 깊이 감독을 포함한 다중 손실 목표 함수를 사용해 엔드 투 엔드 자세 추정을 전통적 SLAM 최적화와 통합한다.
실험 결과
연구 질문
- RQ1단일 전역 반사율 필드에 비해 점진적이고 국소적으로 적응 가능한 신경 장면 표현이 대규모 실내 환경에서 확장성과 견고성 향상에 기여하는가?
- RQ2삼중 평면과 MLP를 조합함으로써 표준 NeRF나 특징 그리드 방법에 비해 메모리 증가를 줄이며 재구성 정확도와 부드러움을 향상시키는가?
- RQ3기존 국소 BA에 비해 국소-전역 버블 조정 전략이 장기 시퀀스에서 누적 자세 오차 감소에 얼마나 기여하는가?
- RQ4엔드 투 엔드 자세 네트워크를 전역 최적화와 통합함으로써 대규모 환경에서 추적 정확도와 견고성이 향상되는가?
- RQ5제안된 시스템은 다양한 실내 데이터셋에서 재구성 및 위치 추정 측면에서 최신 기술 수준의 성능을 달성하면서도 실시간 성능을 유지할 수 있는가?
주요 결과
- 리플리카 데이터셋(소규모 실내 환경)에서 PLGSLAM은 재구성 정밀도와 자세 추정 정확도 측면에서 ESLAM과 Co-SLAM을 모두 능가하며, 실수 없는 고해상도 재구성을 달성한다.
- 스캔넷 데이터셋(대규모 실내 환경, 약 7.5m × 6.6m)에서 PLGSLAM은 NICE-SLAM, ESLAM, Co-SLAM 중에서 가장 낮은 절대 궤적 오차(ATE)를 기록하여 뛰어난 추적 견고성을 입증한다.
- 아파트먼트 데이터셋(대규모, 약 14.5m × 7.5m)에서 PLGSLAM은 상태 기반의 카메라 추적 성능을 달성하며 Co-SLAM 및 ESLAM 대비 상당히 낮은 누적 오차를 기록한다.
- 제거 실험 결과, 삼중 평면과 MLP의 병합 표현이 개별 구성 요소보다 재구성 정확도 향상에 기여함을 확인하였으며, 특히 미세한 세부 사항을 포착하고 구멍을 메우는 데 유의미한 효과가 있다.
- 국소-전역 버블 조정을 제거할 경우 누적 오차가 유의미하게 증가하고 추적 성능이 악화됨을 확인하여, 이 기법이 장기 시퀀스 안정성에 핵심적인 역할을 함을 검증한다.
- 점진적 장면 표현 방법은 전역 추정 오류의 위험을 줄이고 오류 전파를 제한하여 동적 환경에서 시스템의 견고성을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.