Skip to main content
QUICK REVIEW

[論文レビュー] Simultaneous Localization And Mapping with depth Prediction using Capsule Networks for UAVs

Sunil Prakash, Gaelan Gu|arXiv (Cornell University)|Aug 16, 2018
Robotics and Sensor-Based Localization参考文献 9被引用数 4
ひとこと要約

本論文は、空間階層構造とオブジェクトの姿勢を符号化することで、CNNベースの手法を改善するCapsule Networks (CapsNet) を用いた単眼SLAMシステムを提案する。このシステムは、キーフレームベースのカメラポーズ推定と拡張カルマンフィルタ(EKF)に、CapsNetが生成する深度マップを統合し、TUMデータセットにおいてORB-SLAM や CNN-SLAM よりも高い深度推定精度を達成した。TUM/seq3では29.98%の正しい深度予測を達成した。

ABSTRACT

In this paper, we propose an novel implementation of a simultaneous localization and mapping (SLAM) system based on a monocular camera from an unmanned aerial vehicle (UAV) using Depth prediction performed with Capsule Networks (CapsNet), which possess improvements over the drawbacks of the more widely-used Convolutional Neural Networks (CNN). An Extended Kalman Filter will assist in estimating the position of the UAV so that we are able to update the belief for the environment. Results will be evaluated on a benchmark dataset to portray the accuracy of our intended approach.

研究の動機と目的

  • CNNが空間的姿勢やオブジェクトの向きを符号化する能力に限界を示すことを補うために、Capsule Networksからの深度予測を用いた低コストな単眼SLAMシステムの開発を目的とする。
  • CapsNetのベクトルベースの空間的関係表現を活用することで、単カメラUAVナビゲーションにおける深度推定精度を向上させることを目的とする。
  • キーフレームトラッキングとEKFベースのポーズ推定に、CapsNetベースの深度マップを統合し、ロバストな3次元環境再構築を実現することを目的とする。
  • ベンチマークデータセット上で提案手法を評価し、深度予測精度においてORB-SLAM や CNN-SLAM と比較することを目的とする。
  • TUMデータセットで学習したCapsNetモデルが、新しい未確認の屋内環境(異なる照明条件や構造的特徴を有する)に一般化して適応できるかを評価することを目的とする。

提案手法

  • 本システムは、ROSを搭載したParrot AR Quadcopterドローンに単眼前方カメラを搭載し、18fps、640x480解像度の動画を収集してSLAM処理を実行する。
  • CapsNetは入力画像を処理し、動的ルーティングによるキャプセル間の相互作用を通じて、オブジェクトの姿勢と空間階層構造を符号化した密な深度/視差マップを生成する。
  • キーフレームベースのアプローチにより2次元-3次元対応点を検出・追跡し、光学フローと深度マップの制約を用いてEKFによりカメラポーズを推定する。
  • EKFは深度予測と光学フローの残差を融合し、Huberノルムと残差ベースの不確実性モデリングを用いて不確実性を最小化する。
  • ピクセル単位の信頼性を測定することで、予測された視差に対するピクセル単位の自信を評価し、不確実性マップを生成する。
  • EKFベースの状態推定を用いて、深度マップと光学フロー、キーフレームデータを統合し、環境のグローバル3次元マップを構築する。

実験結果

リサーチクエスチョン

  • RQ1Capsule Networksは、UAVアプリケーションにおける単眼SLAMの深度予測精度において、従来のConvolutional Neural Networks(CNN)を上回ることができるか?
  • RQ2CapsNetsのベクトルベースの表現は、従来のCNNと比較して、空間的推論とオブジェクトの姿勢推定をどのように向上させるか?
  • RQ3CapsNetベースの深度予測は、UAVのポーズ推定と3次元マップ再構築の精度をどの程度向上させるか?
  • RQ4TUMデータセットで学習したモデルが、照明条件や構造的特徴が異なる新しい未確認の屋内環境に一般化して適応できるか?
  • RQ5CapsNetの深度マップをEKFとキーフレームトラッキングに統合することで、CNNベースや特徴ベースの手法と比較して、全体的なSLAM性能がどの程度向上するか?

主な発見

  • 提案されたCapsNetベースのSLAMシステムは、TUM/seq3データセットで29.98%の正しい深度予測を達成し、このシーケンスにおいてORB-SLAM(12.477%)とCNN-SLAM(27.396%)を上回った。
  • TUM/seq2では25.784%の正しい深度予測を達成し、CNN-SLAMの24.077%とORB-SLAMの0.059%を上回った。
  • 本システムは一般化能力を示し、独自に構築した屋内アパートデータセット(TUMデータセットとは異なる環境)でも28.590%の正しい深度予測を達成した。
  • TUMの4つのシーケンスのうち3つにおいて、CapsNetベースの深度予測はCNN-SLAMを上回った。これは、空間的推論と特徴符号化の向上を示している。
  • ピクセル単位の信頼性から生成された不確実性マップにより、テクスチャが乏しいまたはコントラストが低い領域における深度推定のロバスト性が向上した。
  • CapsNetの深度マップをEKFと光学フローに統合することで、単眼の制約にもかかわらず、安定した3次元マッピングと正確なUAVポーズ推定がリアルタイムで実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。