Skip to main content
QUICK REVIEW

[논문 리뷰] VOLDOR-SLAM: For the Times When Feature-Based or Direct Methods Are Not Good Enough

Zhixiang Min, Enrique Dunn|arXiv (Cornell University)|2021. 04. 14.
Robotics and Sensor-Based Localization참고 문헌 37인용 수 6
한 줄 요약

VOLDOR+SLAM은 외부 밀도 높은 광학 흐름 추정치를 활용하여 특징 기반 또는 직접 방법이 실패하는 도전적인 환경에서도 강력하고 정확하며 글로벌로 일관된 3차원 맵핑을 가능하게 하는 밀도 높은 간접 SLAM 시스템이다. VOLDOR 확률적 시각적 오도메트리 프레임워크에 기하학적 사전 지식, 적응형 포즈 그래프 관리, 그리고 포인트 투 플레인 역깊이 정렬을 추가하여 단일 GPU에서 약 15 FPS의 실시간 성능을 달성하면서도 ORB-SLAM3와 DSO를 초월하는 정확도와 강건성을 확보한다. 단일 영상, 스테레오, RGB-D 입력 모두에서 성능을 발휘한다.

ABSTRACT

We present a dense-indirect SLAM system using external dense optical flows as input. We extend the recent probabilistic visual odometry model VOLDOR [Min et al. CVPR'20], by incorporating the use of geometric priors to 1) robustly bootstrap estimation from monocular capture, while 2) seamlessly supporting stereo and/or RGB-D input imagery. Our customized back-end tightly couples our intermediate geometric estimates with an adaptive priority scheme managing the connectivity of an incremental pose graph. We leverage recent advances in dense optical flow methods to achieve accurate and robust camera pose estimates, while constructing fine-grain globally-consistent dense environmental maps. Our open source implementation [https://github.com/htkseason/VOLDOR] operates online at around 15 FPS on a single GTX1080Ti GPU.

연구 동기 및 목표

  • 특징 기반 또는 직접 방법이 실패하는 낮은 텍스처, 동적인 환경 또는 열악한 조건에서의 SLAM 한계를 해결하기 위해.
  • VOLDOR 추론 프레임워크에 기하학적 사전 지식을 통합하여 강력한 단일 영상 SLAM을 가능하게 하기 위해.
  • 밀도 높은 광학 흐름을 입력으로 사용하여 실시간이고 글로벌로 일관된 밀도 높은 맵핑 시스템을 개발하기 위해.
  • 기하학적 일관성과 연결성 기반으로 키프레임을 동적으로 연결하는 적응형 우선순위 연결 기반 포즈 그래프 관리 전략을 통해 포즈 그래프 관리를 향상시키기 위해.
  • 희소 특징이나 사진 캘리브레이션에 의존하지 않고도 고정밀도 깊이 추정과 3차원 재구성 성능을 확보하기 위해.

제안 방법

  • VOLDOR 확률적 시각적 오도메트리 모델을 확장하여 단일 영상, 스테레오, RGB-D 환경 모두에서 강력성을 향상시키기 위해 명시적 기하학적 사전 지식을 통합한다.
  • 원천에 관계없이 프레임 정렬을 가능하게 하는 포인트 투 플레인 역깊이 정렬 형식을 적용하여 자세 추정 정확도를 향상시킨다.
  • 기하학적 일관성과 연결성을 기반으로 키프레임 간의 동적 연결을 수행하는 적응형 우선순위 기반 포즈 그래프 관리 전략을 도입한다.
  • 사전에 학습된 네트워크(예: MaskFlowNet)로부터 얻은 밀도 높은 광학 흐름을 입력으로 사용하여 특징 추출 과정을 생략하고 밀도 높은 기하학적 추론을 가능하게 한다.
  • 광학 흐름 배치에 로그-로지스틱 잔차 모델을 적용하여 실시간으로 카메라 운동, 3차원 구조, 추적 신뢰도를 동시에 추론한다.
  • 확률적 융합 전략을 사용하여 키프레임의 깊이 맵을 집계하여 글로벌로 일관된 밀도 높은 3차원 맵을 구성한다.

실험 결과

연구 질문

  • RQ1특징 기반 방법이 실패하는 환경에서 밀도 높은 광학 흐름을 효과적으로 활용하여 강력한 단일 영상 SLAM을 수행할 수 있는가?
  • RQ2기하학적 사전 지식을 밀도 높은 간접 SLAM 파이프라인에 통합하여 단일 영상, 스테레오, RGB-D 입력 모두에서 정확도와 강건성을 향상시킬 수 있는가?
  • RQ3적응형 포즈 그래프 관리 전략은 밀도 높은 SLAM 시스템의 일관성과 확장성에 어떤 영향을 미치는가?
  • RQ4사진 수준의 사실적인 합성 환경에서 전통적인 특징 기반 및 직접 SLAM 방법에 비해 밀도 높은 간접 접근 방식이 얼마나 뛰어난 성능을 보일 수 있는가?
  • RQ5다양한 신뢰도 임계값과 환경 조건 하에서 VOLDOR+SLAM의 깊이 맵 품질은 최신 기술 대비 얼마나 뛰어나게 나타나는가?

주요 결과

  • TartanAir 데이터셋의 모든 시퀀스에서 VOLDOR+SLAM은 ORB-SLAM3와 DSO를 모두 앞서는 최고의 전체 자세 정확도를 확보하였으며, 특히 'ocean'과 'seasonsforest'와 같은 낮은 텍스처 및 동적인 환경에서 두드러진 성능을 보였다.
  • 다양한 환경에서 높은 완전성(0.95 이상)을 유지하여 빠른 운동과 낮은 텍스처 조건에서도 추적의 강건성을 입증하였다.
  • 단일 영상 입력 기준으로 VOLDOR+SLAM은 모든 기준 모델 중에서 가장 높은 회전 정확도를 확보하였으며, 'ocean' 시퀀스에서 중앙값 회전 오차는 0.88°였다.
  • VOLDOR+SLAM의 깊이 맵 분석 결과, 약 50%의 픽셀이 0.99 이상의 신뢰도 점수를 확보하였으며, 이는 고신뢰도 수준에서 이웃성 비율과 EPE 측정치에서 GA-Net과 MaskFlowNet을 크게 앞서는 성능을 보였다.
  • 스테레오 입력은 단일 영상 입력 대비 깊이 정확도 향상에 미미한 기여만을 보였으며, 이는 시스템의 깊이 추정 성능이 단일 영상 시퀀스로부터도 매우 효과적임을 시사한다.
  • 정성적 결과는 움직이는 물체와 동적인 조명 조건이 존재하는 복잡한 시나리오에서도 밀도 높고 글로벌로 일관된 3차원 재구성 결과를 보여주며, 미세한 세부 사항과 최소한의 드리프트를 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.