Skip to main content
QUICK REVIEW

[論文レビュー] Learning Whole-Image Descriptors for Real-time Loop Detection andKidnap Recovery under Large Viewpoint Difference

Manohar Kuse, Shaojie Shen|arXiv (Cornell University)|Apr 15, 2019
Robotics and Sensor-Based Localization参考文献 63被引用数 7
ひとこと要約

本稿では、分離畳み込みに基づく軽量な全体画像記述子と、新しい全ペア損失関数を用いた弱教師付き学習フレームワークを採用することで、大規模な視点差がある状況下でも、ループ検出とキンドゥプ回復が安定して行えるリアルタイムステレオ視覚慣性SLAMシステムを提案する。この手法は、標準のNetVLADと比較して3倍速く、パラメータ数が10分の1にまで削減されながらも、平面内回転や視点変化が大きい困難なシーケンスにおいても高い再現率を維持する。

ABSTRACT

We present a real-time stereo visual-inertial-SLAM system which is able to recover from complicatedkidnap scenarios and failures online in realtime. We propose to learn the whole-image-descriptorin a weakly supervised manner based on NetVLAD and decoupled convolutions. We analyse thetraining difficulties in using standard loss formulations and propose an allpairloss and show itseffect through extensive experiments. Compared to standard NetVLAD, our network takes an orderof magnitude fewer computations and model parameters, as a result runs about three times faster.We evaluate the representation power of our descriptor on standard datasets with precision-recall.Unlike previous loop detection methods which have been evaluated only on fronto-parallel revisits,we evaluate the performace of our method with competing methods on scenarios involving largeviewpoint difference. Finally, we present the fully functional system with relative computation andhandling of multiple world co-ordinate system which is able to reduce odometry drift, recover fromcomplicated kidnap scenarios and random odometry failures. We open source our fully functional system as an add-on for the popular VINS-Fusion.

研究の動機と目的

  • 視点差が大きい状況下で従来の手法が失敗するような視覚SLAMにおけるループ検出とキンドゥプ回復の課題に対処すること。
  • 視点、照明、テクスチャの変化に一般化できるリアルタイムで効率的かつ頑健な視覚的場所認識システムを開発すること。
  • 三重項損失を用いたNetVLADの学習における不安定性を解消するため、新しい全ペア損失関数を導入すること。
  • 長時間にわたる連鎖的キンドゥプに対しても、オンラインで複数の座標系を統合できる仕組みを実現すること。
  • VINS-Fusion向けにデプロイ可能で、プラグイン可能なモジュールを構築し、スライドの低減と障害回復を向上させること。

提案手法

  • 分離畳み込みを用いたNetVLADの弱教師付き学習フレームワークを活用し、モデルサイズと計算時間を削減する。
  • 標準の三重項損失と比較して、特にクラスタ数が少ない状況下でも学習の安定性と性能を向上させるために、全ペア損失関数を導入する。
  • 複数の世界座標系を維持し、ループクロージャー時にそれらの間の相対姿勢を計算するシステムアーキテクチャを設計する。
  • VINS-Fusion内にリアルタイムモジュールとして記述子を統合し、キンドゥプ状況のオンライン検出と回復を可能にする。
  • 世界間ループ候補に基づいて、複数のトラジェクトリをポーズグラフ最適化により統合する。
  • 自己収集シーケンスと標準データセットを用いて学習を行うが、人為的アノテーションを最小限に抑え、時間的近接性を弱教師信号として用いる。

実験結果

リサーチクエスチョン

  • RQ1弱教師付き学習で学習された全体画像記述子は、大規模な視点差や平面内回転がある状況下でも、安定したループ検出を達成できるか?
  • RQ2クラスタ数が限られた状況下で、提案された全ペア損失は三重項損失と比較して、学習の安定性と性能をどのように向上させるか?
  • RQ3軽量で分離畳み込みに基づくネットワークは、計算コストをどれほど削減できるか、同時に場所認識の正確性を維持できるか?
  • RQ4複数の座標系を用いることで、リアルタイムに長時間にわたる連鎖的キンドゥプ状況を検出し、回復できるか?
  • RQ5実世界のシーケンスにおいて、最先端のBOVWおよびCNNベースの手法と比較して、精度、再現率、推論速度の観点で本手法はどのように優れているか?

主な発見

  • 提案された全ペア損失は、特にクラスタ数が少ない状況下で、学習の安定性と性能を顕著に向上させ、再現率と収束性の両面で三重項損失を上回る。
  • 分離畳み込みのおかげで、標準のNetVLADと比較して約3倍高速に動作し、学習可能なパラメータ数が5~7倍も削減される。
  • 大規模な視点差と平面内回転を伴うシーケンスにおいて、本手法はDBOW2や他のBOVWベースの手法と比較して顕著に高い再現率を達成する。
  • 複数のキンドゥプ状況をリアルタイムに検出し、図1に示すように、異なる座標系間のトラジェクトリをライブで統合することができた。
  • 照明の変化、低テクスチャ、視点変化に対して本記述子は頑健であり、標準データセットおよび自作で収集した困難なデータセットにおいても強力な一般化性能を示した。
  • VINS-Fusionプラグインとしてのオープンソース実装により、リアルタイムデプロイが可能となり、将来的な長期的自律走行やセマンティックSLAM分野の研究を促進する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。