Skip to main content
QUICK REVIEW

[論文レビュー] IV-SLAM: Introspective Vision for Simultaneous Localization and Mapping

Sadegh Rabiee, Joydeep Biswas|arXiv (Cornell University)|Aug 6, 2020
Robotics and Sensor-Based Localization参考文献 33被引用数 5
ひとこと要約

IV-SLAM は、自己内省的学習フレームワークを用いて、影、反射、低コントラストテクスチャなどの困難な画像領域からの信頼性の低い特徴量を特定・低重み化することで、視覚的SLAMのロバスト性を向上させる文脈に配慮した自己教師付きノイズモデリング手法を提案する。実世界のデータにおいて、ORB-SLAMと比較して、トラッキング誤差を低減し、故障間の平均距離を70%以上向上させる。

ABSTRACT

Existing solutions to visual simultaneous localization and mapping (V-SLAM) assume that errors in feature extraction and matching are independent and identically distributed (i.i.d), but this assumption is known to not be true -- features extracted from low-contrast regions of images exhibit wider error distributions than features from sharp corners. Furthermore, V-SLAM algorithms are prone to catastrophic tracking failures when sensed images include challenging conditions such as specular reflections, lens flare, or shadows of dynamic objects. To address such failures, previous work has focused on building more robust visual frontends, to filter out challenging features. In this paper, we present introspective vision for SLAM (IV-SLAM), a fundamentally different approach for addressing these challenges. IV-SLAM explicitly models the noise process of reprojection errors from visual features to be context-dependent, and hence non-i.i.d. We introduce an autonomously supervised approach for IV-SLAM to collect training data to learn such a context-aware noise model. Using this learned noise model, IV-SLAM guides feature extraction to select more features from parts of the image that are likely to result in lower noise, and further incorporate the learned noise model into the joint maximum likelihood estimation, thus making it robust to the aforementioned types of errors. We present empirical results to demonstrate that IV-SLAM 1) is able to accurately predict sources of error in input images, 2) reduces tracking error compared to V-SLAM, and 3) increases the mean distance between tracking failures by more than 70% on challenging real robot data compared to V-SLAM.

研究の動機と目的

  • 再投影誤差が独立同分布(i.i.d.)であるというV-SLAMの仮定が、影、反射、低コントラストテクスチャなどの現実世界の条件下で成立しないという限界に対処する。
  • 手作業で設計されたヒューリスティクスやセマンティックセグメンテーションに依存するのではなく、画像の文脈から失敗要因を自律的に学習する。
  • 統合された最大尤度推定に、学習された文脈依存のノイズモデルを組み込むことで、SLAMのロバスト性と精度を向上させる。
  • トレーニングデータに失敗要因の手動アノテーションが不要な、自己教師付きの失敗予測を可能にする。

提案手法

  • 深層ニューラルネットワークを訓練し、画像の文脈に基づいて特徴量の信頼性を予測させ、影、反射、高周波数テクスチャなどの誤差要因を特定する。
  • SLAM最適化の整合性を活用して、偽ラベルを生成する微分可能な損失関数を用いた自己教師付きの監視を実施し、失敗予測のための自己教師付き学習を実現する。
  • 異分散性ノイズを明示的に扱う文脈に配慮したノイズモデルを構築し、信頼性の低い画像領域からの特徴量に対して高い不確実性を割り当てる。
  • 学習されたノイズモデルをSLAMの統合的最大尤度推定に統合し、予測された信頼性に応じて特徴量の影響を調整する。
  • 予測されたノイズが低い領域を優先して特徴量抽出を動的に誘導し、マッチング前の入力特徴量の品質を向上させる。
  • フレーム間の時間的整合性を活用して失敗予測を精緻化し、実稼働時のロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1手動アノテーションが不要な自己教師付きモデルは、視覚的SLAMにおける失敗要因を正確に予測できるか?
  • RQ2文脈に配慮したノイズモデルは、現実世界のV-SLAMシステムにおけるトラッキング精度と故障耐性をどのように向上させるか?
  • RQ3標準的なV-SLAMと比較して、IV-SLAMはトラッキング誤差をどの程度低減し、故障間の平均距離(MDBF)を延長するか?
  • RQ4内省的モデルは、レンズフレアや動的影といった未観測の失敗モードにも一般化可能か?
  • RQ5SLAM最適化に学習された信頼性スコアを統合することで、全体のトラジェクトリ推定が向上するか?

主な発見

  • 実世界のデータセットにおいて、IV-SLAMは、ORB-SLAMと比較して並進誤差を35%低減し、故障間の平均距離(MDBF)を70%以上向上させる。
  • モデルは、影、反射、レンズフレアなどの失敗要因を正確に予測しており、図6の緑点/赤点がそれぞれ予測された信頼性のある特徴量と信頼性の低い特徴量を示している。
  • シミュレーション環境では、IV-SLAMは並進誤差を35%低減し、MDBFを35%向上させる。
  • IV-SLAMは、移動する影や鏡面反射由来の特徴量によるORB-SLAMの深刻な故障が発生しても、ロボットの軌道を正常にトラッキングする。
  • 学習されたノイズモデルは、アスファルトや植生などの曖昧なテクスチャや動的物体由来の特徴量を効果的に低重み化し、ロバスト性を向上させる。
  • 自己教師付きトレーニング方式により、真値ラベルが不要な状態で失敗パターンを学習可能であり、スケーラビリティと自律性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。