Skip to main content
QUICK REVIEW

[論文レビュー] DXSLAM: A Robust and Efficient Visual SLAM System with Deep Features

Dongjiang Li, Xuesong Shi|arXiv (Cornell University)|Aug 12, 2020
Robotics and Sensor-Based Localization参考文献 40被引用数 9
ひとこと要約

DXSLAMは、動的で変化する環境においても高い耐障害性を発揮する、深層畳み込みニューラルネットワーク(CNN)を活用したリアルタイムでGPU不要のビジュアルSLAMシステムを提案する。HF-Netという最先端のCNNを統合し、Intel OpenVINOによる最適化とFast BoWを用いたループクロージャー処理を実装することで、ORB-SLAM2 や DS-SLAM よりも低いトラジェクトリーエラーと高い再局在成功率を達成し、CPUオンliyプラットフォームで約15 Hzで動作する。

ABSTRACT

A robust and efficient Simultaneous Localization and Mapping (SLAM) system is essential for robot autonomy. For visual SLAM algorithms, though the theoretical framework has been well established for most aspects, feature extraction and association is still empirically designed in most cases, and can be vulnerable in complex environments. This paper shows that feature extraction with deep convolutional neural networks (CNNs) can be seamlessly incorporated into a modern SLAM framework. The proposed SLAM system utilizes a state-of-the-art CNN to detect keypoints in each image frame, and to give not only keypoint descriptors, but also a global descriptor of the whole image. These local and global features are then used by different SLAM modules, resulting in much more robustness against environmental changes and viewpoint changes compared with using hand-crafted features. We also train a visual vocabulary of local features with a Bag of Words (BoW) method. Based on the local features, global features, and the vocabulary, a highly reliable loop closure detection method is built. Experimental results show that all the proposed modules significantly outperforms the baseline, and the full system achieves much lower trajectory errors and much higher correct rates on all evaluated data. Furthermore, by optimizing the CNN with Intel OpenVINO toolkit and utilizing the Fast BoW library, the system benefits greatly from the SIMD (single-instruction-multiple-data) techniques in modern CPUs. The full system can run in real-time without any GPU or other accelerators. The code is public at https://github.com/ivipsourcecode/dxslam.

研究の動機と目的

  • 複雑で変化しやすい環境におけるハンドクラフト特徴量の限界を克服する、堅牢で効率的なビジュアルSLAMシステムの開発。
  • GPUアクセラレーションなしのCPUオンリーモバイルプラットフォームでも、深層特徴量ベースのSLAMシステムをリアルタイムで動作可能にする。
  • 深層局所特徴量とグローバル特徴量の組み合わせおよび新規ビジュアルボキャブラリーを用いて、ループクロージャー検出と再局在を強化する。
  • Intel OpenVINOとFast BoWを用いて深層特徴量抽出とBoWベースのリtrievalを最適化し、最新のCPU上で高い効率性を実現する。
  • 深層特徴量が、トラジェクトリーエラーの低減と再局在成功率の向上という点でSLAM性能を顕著に改善することを実証する。

提案手法

  • システムは、最新のCNNであるHF-Netを用い、各フレームから局所キーポoinト記述子とグローバル画像記述子を同時に抽出する。
  • 局所特徴量はポーズトラッキングとローカルマッピングに使用され、グローバル特徴量は堅牢な画像検索と再局在を可能にする。
  • 深層局所特徴量を用いたBag-of-Words(BoW)法により、新規ビジュアルボキャブラリーを学習し、ループクロージャー検出の精度を向上させる。
  • ループクロージャー検出は、グローバル特徴量の類似度と局所特徴量のマッチングを組み合わせることで、より信頼性の高い検出を実現する。
  • 再局在は、グローバル特徴量に基づく画像検索に続いて、局所特徴量のグループワイズマッチングを実施することで、成功率の向上と計算量の低減を図る。
  • システム全体はIntel OpenVINOによるCPU推論最適化とFast BoWによる効率的リtrievalを組み合わせており、低消費電力CPU上でもリアルタイム動作を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層CNNベースの特徴量は、動的で視点が変化する環境において、ビジュアルSLAMシステムの耐障害性を顕著に向上させることができるか?
  • RQ2GPUアクセラレーションなしのCPUオンリープラットフォームでも、深層特徴量ベースのSLAMシステムがリアルタイム動作を達成できるか?
  • RQ3局所特徴量とグローバル特徴量の両方を組み合わせることで、ハンドクラフト特徴量と比較して、ループクロージャー検出と再局在がどの程度向上するか?
  • RQ4OpenVINOとFast BoWによる最適化によって、推論遅延がどの程度低減され、低消費電力ハードウェア上でのリアルタイム動作が可能になるか?
  • RQ5深層局所特徴量から学習されたビジュアルボキャブラリーは、従来のBoW手法と比較して、ループクロージャーの正確性を向上させるか?

主な発見

  • DXSLAMは、fr3_walking_staticシーケンスにおいて、ORB-SLAM2の0.3900mと比較して、ATE RMSEが0.0167mにまで低下し、顕著に低いトラジェクトリーエラーを達成した。
  • fr3_sitting_staticシーケンスでは、ATE RMSEが0.0068mにまで低減され、ORB-SLAM2およびDS-SLAMを上回る性能を発揮した。
  • OpenLORIS-Sceneデータセットでは、DXSLAMの再局在成功率が98.5%に達し、ベースラインのBoWベース手法を顕著に上回った。
  • OpenVINO最適化により、CPU上でのHF-Net推論時間が1フレームあたり46.2ms(21.6 FPS)にまで短縮され、Intel NUC上で約15 Hzのリアルタイム動作が実現した。
  • インクリメンタルなビジュアルボキャブラリー学習法は、非インクリメンタルな学習法と比較して、全テストシーケンスにおいて再局在とポーズ推定の精度を向上させ、より多くの正しい推定を達成した。
  • 本システムは、GPUやアクセラレータを一切使用しない15WのCPU上でもリアルタイムで動作し、モバイルロボットへの実装可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。