Skip to main content
QUICK REVIEW

[논문 리뷰] DXSLAM: A Robust and Efficient Visual SLAM System with Deep Features

Dongjiang Li, Xuesong Shi|arXiv (Cornell University)|2020. 08. 12.
Robotics and Sensor-Based Localization참고 문헌 40인용 수 9
한 줄 요약

DXSLAM은 GPU를 사용하지 않는 실시간 비디오 SLAM 시스템을 제안하며, 깊이 학습 기반의 컨volution 신경망(CNN)을 활용해 동적이고 변화하는 환경에서도 높은 내구성을 확보한다. 최신 CNN(HF-Net)을 사용하고 Intel OpenVINO 최적화 및 Fast BoW를 통합함으로써 ORB-SLAM2와 DS-SLAM보다 더 낮은 궤적 오차와 더 높은 재정렬 성공률을 달성하며, GPU가 없는 플랫폼에서 약 ~15 Hz로 작동한다.

ABSTRACT

A robust and efficient Simultaneous Localization and Mapping (SLAM) system is essential for robot autonomy. For visual SLAM algorithms, though the theoretical framework has been well established for most aspects, feature extraction and association is still empirically designed in most cases, and can be vulnerable in complex environments. This paper shows that feature extraction with deep convolutional neural networks (CNNs) can be seamlessly incorporated into a modern SLAM framework. The proposed SLAM system utilizes a state-of-the-art CNN to detect keypoints in each image frame, and to give not only keypoint descriptors, but also a global descriptor of the whole image. These local and global features are then used by different SLAM modules, resulting in much more robustness against environmental changes and viewpoint changes compared with using hand-crafted features. We also train a visual vocabulary of local features with a Bag of Words (BoW) method. Based on the local features, global features, and the vocabulary, a highly reliable loop closure detection method is built. Experimental results show that all the proposed modules significantly outperforms the baseline, and the full system achieves much lower trajectory errors and much higher correct rates on all evaluated data. Furthermore, by optimizing the CNN with Intel OpenVINO toolkit and utilizing the Fast BoW library, the system benefits greatly from the SIMD (single-instruction-multiple-data) techniques in modern CPUs. The full system can run in real-time without any GPU or other accelerators. The code is public at https://github.com/ivipsourcecode/dxslam.

연구 동기 및 목표

  • 복잡하고 변화하는 환경에서 수작업으로 설계된 특징의 한계를 극복하는 내구성 있고 효율적인 비디오 SLAM 시스템을 개발하는 것.
  • GPU 가속 기능이 없는 모바일 CPU 전용 플랫폼에서 딥 레이어 기반 SLAM 시스템의 실시간 동작을 가능하게 하는 것.
  • 딥 레이어 기반 局소 및 전역 특징의 조합과 새로운 시각 어휘를 활용해 루프 클로징 탐지 및 재정렬 성능을 향상시키는 것.
  • Intel OpenVINO와 Fast BoW를 활용해 딥 레이어 특징 추출 및 BoW 기반 검색을 최적화하여 현대 CPU에서 높은 효율성을 확보하는 것.
  • 딥 레이어 특징이 궤적 정확도 및 재정렬 성공률 측면에서 SLAM 성능을 크게 향상시킨다는 것을 입증하는 것.

제안 방법

  • 시스템은 최신 기술인 HF-Net을 사용해 각 프레임으로부터 局소 키포인트 기술자와 전역 이미지 기술자를 동시에 추출한다.
  • 국소 특징은 자세 추적 및 국소 맵핑에 사용되며, 전역 특징은 강건한 이미지 검색 및 재정렬을 가능하게 한다.
  • 딥 레이어 기반 국소 특징을 기반으로 Bag-of-Words(BoW) 방법을 사용해 새로운 시각 어휘를 학습시켜 루프 클로징 탐지 성능을 향상시킨다.
  • 루프 클로징 탐지는 전역 특징 유사도와 국소 특징 매칭을 결합해 더 높은 신뢰도를 확보한다.
  • 재정렬은 전역 특징 기반 이미지 검색 후 국소 특징의 그룹별 매칭을 수행해 성공률를 높이고 계산량을 줄인다.
  • 전체 시스템은 CPU 인fer런스를 최적화하기 위해 Intel OpenVINO와 Fast BoW를 활용해 최적화되어 있으며, 저전력 CPU에서도 실시간 성능을 구현한다.

실험 결과

연구 질문

  • RQ1딥 CNN 기반 특징이 변화가 심하고 시점이 빠르게 변하는 환경에서 비디오 SLAM 시스템의 내구성을 크게 향상시킬 수 있는가?
  • RQ2딥 레이어 기반 SLAM 시스템이 GPU 가속 없이 CPU 전용 플랫폼에서 실시간으로 동작할 수 있는가?
  • RQ3국소 및 전역 딥 레이어 특징의 조합이 수작업 특징에 비해 루프 클로징 탐지 및 재정렬 성능을 얼마나 향상시키는가?
  • RQ4OpenVINO 및 Fast BoW 최적화를 통해 추론 지연 시간을 얼마나 줄일 수 있으며, 저전력 하드웨어에서 실시간 동작을 얼마나 잘 지원할 수 있는가?
  • RQ5딥 레이어 기반 국소 특징에서 학습된 시각 어휘가 기존 BoW 방법에 비해 루프 클로징 정확도를 향상시키는가?

주요 결과

  • DXSLAM은 ORB-SLAM2와 DS-SLAM보다 유의미하게 낮은 궤적 오차를 기록하며, fr3_walking_static 시퀀스에서 ATE RMSE가 0.0167m로 측정되었고, ORB-SLAM2의 0.3900m보다 훨씬 낮았다.
  • fr3_sitting_static 시퀀스에서는 ATE RMSE를 0.0068m로 줄여 ORB-SLAM2와 DS-SLAM를 모두 앞섰다.
  • OpenLORIS-Scene 데이터셋에서 DXSLAM은 98.5%의 재정렬 성공률을 달성했으며, 기존 BoW 기반 방법보다 뚜렷하게 뛰어난 성능을 보였다.
  • OpenVINO 최적화를 통해 CPU에서 HF-Net의 추론 시간은 1프레임당 46.2ms(21.6 FPS)로 단축되어 Intel NUC에서 약 ~15 Hz로 실시간 동작이 가능해졌다.
  • 증분식 시각 어휘 학습 방법은 비증분식 학습 대비 재정렬 및 자세 추정 정확도를 향상시켰으며, 모든 시험 시퀀스에서 더 많은 정확한 추정치를 기록했다.
  • 시스템은 GPU나 가속기 없이도 15W CPU에서 실시간으로 작동하며, 이는 모바일 로봇에의 구현 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.