Skip to main content
QUICK REVIEW

[論文レビュー] Attention-SLAM: A Visual Monocular SLAM Learning from Human Gaze

Jinquan Li, Ling Pei|arXiv (Cornell University)|Sep 15, 2020
Robotics and Sensor-Based Localization参考文献 41被引用数 5
ひとこと要約

本論文は、特徴点の重み付けに人間の注視にインspiredされた注目度モデル(SalNavNet)を統合することで、精度と耐障害性を向上させるモノクローラル視覚SLAMシステム、Attention-SLAMを提案する。中心部バイアスを軽減し、注目度マップを用いて注目度の高い物体を優先することで、Salient Euroc データセット上でDSO、ORB-SLAM、Salient DSOよりも軌道精度が高く、不確実性が低減されている。

ABSTRACT

This paper proposes a novel simultaneous localization and mapping (SLAM) approach, namely Attention-SLAM, which simulates human navigation mode by combining a visual saliency model (SalNavNet) with traditional monocular visual SLAM. Most SLAM methods treat all the features extracted from the images as equal importance during the optimization process. However, the salient feature points in scenes have more significant influence during the human navigation process. Therefore, we first propose a visual saliency model called SalVavNet in which we introduce a correlation module and propose an adaptive Exponential Moving Average (EMA) module. These modules mitigate the center bias to enable the saliency maps generated by SalNavNet to pay more attention to the same salient object. Moreover, the saliency maps simulate the human behavior for the refinement of SLAM results. The feature points extracted from the salient regions have greater importance in optimization process. We add semantic saliency information to the Euroc dataset to generate an open-source saliency SLAM dataset. Comprehensive test results prove that Attention-SLAM outperforms benchmarks such as Direct Sparse Odometry (DSO), ORB-SLAM, and Salient DSO in terms of efficiency, accuracy, and robustness in most test cases.

研究の動機と目的

  • 視覚的注目度にインspiredした人間のような注目メカニズムを組み込むことで、モノクローラルSLAMの精度と耐障害性を向上させること。
  • 従来のSLAMシステムが意味的関連性にかかわらずすべての特徴点を同等に扱うという限界を是正すること。
  • 情報理論と注目度ベースのキーフレーム選択を用いて、ポーズ推定の不確実性を低減すること。
  • 注目度マップでラベル付けされたナビゲーション指向のSLAM評価に適した新しいベンチマークデータセット「Salient Euroc」を構築すること。
  • 非ナビゲーション用途のデータセットで訓練された注目度モデルが、SLAM性能に悪影響を及える中心部バイアスの有無を調査すること。

提案手法

  • 中心部バイアスを低減し、注目度予測の時間的整合性を向上させるために、相関モジュールと適応的指数移動平均(EMA)を備えた視覚的注目度モデル「SalNavNet」を提案する。
  • 注目度領域内の特徴点に高い最適化重みを割り当てる重み付きBundle Adjustmentフレームワークを導入し、トラッキングの安定性を向上させる。
  • 情報理論を用いて、注目度に基づく不確実性低減を基準にキーフレームを選択することで、効率性と精度を向上させる。
  • SalNavNetを用いて注目度アノテーションを追加することで、元のEurocデータセットに新たなオープンソースデータセット「Salient Euroc」を生成する。
  • 比較のためのベースラインとして、SalGANとSalEMAを用い、SLAM文脈における性能差を分析する。
  • 注目度マップを注目度マスクとして用い、特徴点選択と最適化をガイドすることで、フレーム間での注目度の高い物体の一貫したトラッキングを実現する。

実験結果

リサーチクエスチョン

  • RQ1一般画像データセットで訓練された注目度モデルは、ナビゲーションタスクに応用された場合、モノクローラルSLAM性能を効果的に向上させることができるか?
  • RQ2既存の注目度モデルに見られる中心部バイアスは、特に物体が画像フレーム内で移動する際のSLAM精度にどのように影響するか?
  • RQ3Bundle Adjustmentに注目度ベースの重み付けを組み込むことで、標準的なSLAM手法と比較してポーズ推定の不確実性が低減するか?
  • RQ4注目度モデルの訓練データの選択が、注目度拡張SLAMシステムの性能にどの程度影響を与えるか?
  • RQ5注目度に配慮したSLAMシステムは、ORB-SLAM や DSO といった最先端のベンチマークを上回る精度と耐障害性を達成できるか?

主な発見

  • Attention-SLAMは、主に中程度および容易な難易度のEurocシーケンスにおいて、DSO、ORB-SLAM、Salient DSOよりも低い軌道誤差を達成した。
  • SALICONで訓練されたSalGANが、DHF1Kで訓練されたSalEMA(LSTMを用いる)よりも注目度マップの性能が優れており、これはSALICONの中心部バイアスが弱いことに起因する。
  • SalNavNetは中心部バイアスを効果的に低減し、物体が画像の中心から端に移動しても、注目度の高い物体の一貫したトラッキングを可能にした。
  • 情報理論的分析により、注目度ベースのキーフレーム選択を用いることで、ポーズ推定の不確実性が低減していることが検証された。
  • 運動ノイズや高速回転は、特にMH04、MH05、V103、V203で性能を劣化させ、特徴抽出の悪化と注目度マップのずれが原因である。
  • 今後の注目度駆動型視覚SLAM研究を支援するため、オープンソースの「Salient Euroc」データセットを公開した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。