Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Objects Segmentation for Visual Localization in Urban Environments

Zhou Guo-xiang, Berta Bescos|arXiv (Cornell University)|Jul 9, 2018
Robotics and Sensor-Based Localization参考文献 23被引用数 5
ひとこと要約

本論文では、合成データ(CARLA)と実世界のRGBデータの組み合わせを用いて、都市環境における動的オブジェクトのリアルタイムインスタンスセグメンテーションを実現する半教師ありのCNNベース手法を提案する。マスクR-CNNバックボーンを用いてエンドツーエンドで訓練されたモデルは、Cityscapesで最先端の性能を達成し、実データでファインチューニングされたバージョン(m_real)は、合成データのみで訓練されたモデルと比べて顕著な性能向上を示し、事前にセマンティッククラスラベルを用意せずに未学習の都市環境への一般化能力が優れていることを示している。

ABSTRACT

Visual localization and mapping is a crucial capability to address many challenges in mobile robotics. It constitutes a robust, accurate and cost-effective approach for local and global pose estimation within prior maps. Yet, in highly dynamic environments, like crowded city streets, problems arise as major parts of the image can be covered by dynamic objects. Consequently, visual odometry pipelines often diverge and the localization systems malfunction as detected features are not consistent with the precomputed 3D model. In this work, we present an approach to automatically detect dynamic object instances to improve the robustness of vision-based localization and mapping in crowded environments. By training a convolutional neural network model with a combination of synthetic and real-world data, dynamic object instance masks are learned in a semi-supervised way. The real-world data can be collected with a standard camera and requires minimal further post-processing. Our experiments show that a wide range of dynamic objects can be reliably detected using the presented method. Promising performance is demonstrated on our own and also publicly available datasets, which also shows the generalization capabilities of this approach.

研究の動機と目的

  • 特徴追跡とマップ整合性の低下を引き起こす動的オブジェクトが多数存在する高動的都市環境において、視覚ベースのSLAMのロバスト性を向上させること。
  • 事前に定義されたセマンティックカテゴリーや手動アノテーションを必要とせずに、動的オブジェクトインスタンスを検出する手法を開発すること。
  • 標準的なRGBカメラと最小限の後処理のみを用いて、リアルタイムかつフレーム単位の動的インスタンスセグメンテーションを可能にすること。
  • 実世界データと合成データの組み合わせを用いて、多様な都市環境における一般化性能を評価すること。

提案手法

  • マスクR-CNNベースのインスタンスセグメンテーションネットワークを、CARLAシミュレータからの合成データと実世界のRGB動画スニペットの組み合わせを用いて、半教師ありの方法で訓練する。
  • モデルのバックボーンは、まず合成データで事前学習し、その後2段階で実世界データでファインチューニングする:最初にヘッドのみを訓練し、次に全層を同時にファインチューニングする。
  • 動的オブジェクトマスクは、動きの整合性と外観変化検出に基づく自己教師ありアプローチを用いて、実世界データから自動で抽出する。
  • 訓練には、実データと合成データを50/50に混ぜたデータ、実データのみ、合成データのみのデータセットを用い、一般化性能を比較する。
  • 最終的なモデルは、Cityscapes Fineデータセットの正例マスクと比較して、バイナリマスクのF1スコアで評価され、動的クラスは1つのカテゴリに統合される。
  • 動画デモでは、木、旗、動物などの複雑な動的要素を含む都市シーンにおけるリアルタイム推論が示されている。

実験結果

リサーチクエスチョン

  • RQ1CNNベースのモデルは、事前に定義されたセマンティックカテゴリに依存せずに、都市環境における一般的な動的オブジェクトインスタンスを検出できるか?
  • RQ2合成データと実世界データの組み合わせが、実都市環境における動的インスタンスセグメンテーションの一般化性能にどのように影響するか?
  • RQ3完全に合成データで訓練した場合と比較して、実世界データでのファインチューニングが、動的シーンセグメンテーションの性能に顕著な向上をもたらすか?
  • RQ4自己教師あり手法を用いることで、最小限のアノテーション作業で実世界のRGBシーケンスから正確な動的オブジェクトマスクを抽出できるか?
  • RQ5本モデルは、学習分布外の未確認の都市や環境条件に対しても、どの程度一般化できるか?

主な発見

  • 実世界データのみで訓練されたモデル(m_real)は、Cityscapesデータセットの全テスト都市において、最も高いF1スコアを達成し、混合データおよび合成データのみで訓練されたバージョンを上回った。
  • 合成データのみで訓練されたモデル(m_synth)は、合成データで事前学習したにもかかわらず、実世界の視覚的変化に一般化が著しく劣っており、F1スコアが顕著に低かった。
  • m_realモデルは、合成データで訓練されたモデルが見逃した、場所固有の動的要素(移動する木、旗、動物など)を優れた能力で検出できた。
  • 合成データでの事前学習と実世界データでのファインチューニングの組み合わせは、混合データで学習するよりも効果的であり、シミュレーションと現実の間のドメインシフトが両方を同時に使用した場合の性能を制限することが示唆された。
  • 自己教師ありマスク抽出手法は、最小限の手動アノテーションで実世界動画から高品質な動的インスタンスマスクを効果的に生成でき、スケーラブルなデータ収集を可能にした。
  • 定性的な結果から、m_realは、訓練データに存在しないさまざまな天候、照明、動的オブジェクトタイプを含む多様な都市シーンに対しても、良好な一般化性能を示していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。