Skip to main content
QUICK REVIEW

[論文レビュー] Movable-Object-Aware Visual SLAM via Weakly Supervised Semantic Segmentation

Ting Sun, Yuxiang Sun|arXiv (Cornell University)|Jun 9, 2019
Robotics and Sensor-Based Localization参考文献 40被引用数 12
ひとこと要約

本論文は、視覚SLAMにおける動的環境下での移動物体の検出を目的とした弱教師ありセマンティックセグメンテーション手法を提案する。これにより、ORB-SLAM2は移動物体をランドマークとして使用するのを回避できる。画像レベルのラベルと条件付きランダムフィールド(CRF)を活用した弱教師あり学習により、高価なピクセル単位のアノテーションを必要とせず、TUM RGB-DおよびKITTIデータセットで最先端の性能を達成した。

ABSTRACT

Moving objects can greatly jeopardize the performance of a visual simultaneous localization and mapping (vSLAM) system which relies on the static-world assumption. Motion removal have seen successful on solving this problem. Two main streams of solutions are based on either geometry constraints or deep semantic segmentation neural network. The former rely on static majority assumption, and the latter require labor-intensive pixel-wise annotations. In this paper we propose to adopt a novel weakly-supervised semantic segmentation method. The segmentation mask is obtained from a CNN pre-trained with image-level class labels only. Thus, we leverage the power of deep semantic segmentation CNNs, while avoid requiring expensive annotations for training. We integrate our motion removal approach with the ORB-SLAM2 system. Experimental results on the TUM RGB-D and the KITTI stereo datasets demonstrate our superiority over the state-of-the-art.

研究の動機と目的

  • 動的環境における移動物体の影響によって引き起こされる視覚SLAM性能の低下を是正すること。
  • 静的物体が大多数を占めるという仮定に依存する従来の動き除去手法の限界を克服し、高価なピクセル単位のアノテーションを不要とする。
  • 最小限の監視で実用的かつ柔軟に適用可能な深層学習ベースの動的環境向けSLAMソリューションを開発すること。
  • 弱教師ありセマンティックセグメンテーションをORB-SLAM2に統合し、特徴点が移動物体領域に割り当てられるのを防止すること。
  • 都市部走行や屋内ナビゲーションなどの実世界シナリオにおける長期的なデータアソシエーションと耐障害性を向上させること。

提案手法

  • 画像レベルのクラスラベルのみを用いて事前学習された深層畳み込みニューラルネットワーク(CNN)を用いて弱教師ありセマンティックセグメンテーションを実行する。
  • 粗いセグメンテーション出力を高密度なピクセル単位のマスクに精緻化するために、条件付きランダムフィールド(CRF)を適用する。
  • 事前に定義された移動物体カテゴリ(例:車両、人間)に属するすべてのピクセルを特定するバイナリマスクを構築する。
  • ORB-SLAM2のトラッキングモジュールにこのバイナリマスクを統合し、移動物体領域における特徴点の割り当てを抑制する。
  • 利用可能な場合、深度情報をCRFの精緻化プロセスに組み込み、マスクの正確性を向上させる。
  • フロントエンドの特徴管理ロジックのみを変更することで、標準のORB-SLAM2との互換性を維持する。

実験結果

リサーチクエスチョン

  • RQ1ピクセル単位のアノテーションを必要とせずに、弱教師ありセマンティックセグメンテーションが動的シーンにおける移動物体を効果的に検出できるか。
  • RQ2弱教師ありセグメンテーションの統合が、ORB-SLAM2の動的環境下での耐障害性にどのように寄与するか。
  • RQ3CRFの精緻化プロセスに深度情報を組み込むことで、動き認識SLAMのセグメンテーション正確性がどの程度向上するか。
  • RQ4提案手法がベンチマークデータセットにおいて、位置推定の正確性と耐障害性の面で既存の最先端手法を上回るか。
  • RQ5高密度な動的物体が存在する状況でも、短時間トラッキングと長期的なループクロージャーの正確性を維持できるか。

主な発見

  • TUM RGB-Dデータセットにおいて、シーケンス06ではトランスレーションRPE RMSEがORB-SLAM2と比較して31.01%改善された。
  • KITTIステレオデータセットにおいて、シーケンス09では絶対軌道誤差(ATE)が49.17%改善され、ベースラインを著しく上回った。
  • KITTIデータセットの10シーケンス中6シーケンスで最先端の性能を達成し、特にシーケンス06、07、09で顕著な向上が見られた。
  • CRFの精緻化プロセスに深度情報を組み込むことで、セグメンテーション品質が向上し、より良い動き認識SLAM性能が得られた。
  • 高密度な動的物体が存在する状況でも、長期的なループクロージャーの堅牢性を維持し、データアソシエーションにおける誤検出を低減した。
  • セマンティックセグメンテーションの平均推論時間は1画像あたり1.27秒であり、中程度の速度でのリアルタイムデプロイメントの可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。