Skip to main content
QUICK REVIEW

[論文レビュー] Driven to Distraction: Self-Supervised Distractor Learning for Robust Monocular Visual Odometry in Urban Environments

Dan Barnes, Will Maddern|arXiv (Cornell University)|Nov 17, 2017
Video Surveillance and Tracking Methods参考文献 24被引用数 5
ひとこと要約

本論文では、複数回の3Dマップ走査データを用いて、自己教師あり手法によりピクセル単位の一時的特徴マスク(静的・動的シーン領域の識別)を学習する手法を提案する。この手法により、都市部の動的環境においても、ロバストな単眼視覚オドメトリ(VO)が可能となり、移動する車両に90%以上が覆われた状態でも、正確な運動推定を維持する。学習済みの深度と一時的特徴マスクをVOパイプラインに組み込むことで、外れ値の排除が可能となり、オドメトリのずれが低減する。

ABSTRACT

We present a self-supervised approach to ignoring "distractors" in camera images for the purposes of robustly estimating vehicle motion in cluttered urban environments. We leverage offline multi-session mapping approaches to automatically generate a per-pixel ephemerality mask and depth map for each input image, which we use to train a deep convolutional network. At run-time we use the predicted ephemerality and depth as an input to a monocular visual odometry (VO) pipeline, using either sparse features or dense photometric matching. Our approach yields metric-scale VO using only a single camera and can recover the correct egomotion even when 90% of the image is obscured by dynamic, independently moving objects. We evaluate our robust VO methods on more than 400km of driving from the Oxford RobotCar Dataset and demonstrate reduced odometry drift and significantly improved egomotion estimation in the presence of large moving vehicles in urban traffic.

研究の動機と目的

  • 大型の移動物体(例:バス)が視覚特徴を支配する都市部環境において、運動推定の失敗を解決すること。
  • 動的物体が多数を占める場合に失敗する伝統的なRANSACベースの外れ値除外手法の限界を克服すること。
  • 手動ラベル付けや事前定義されたセマンティッククラスを必要としない、自己教師ありの方法で一時的特徴マスクを学習すること。
  • 複雑で動的な都市環境において、単一のモノクロナルカメラのみを用いて計測スケールの視覚オドメトリを実現すること。
  • 一時的特徴マスクと深度推定をVOパイプラインに統合し、不要な特徴を抑制することで、運動推定のロバスト性を向上させること。

提案手法

  • LIDARを搭載した調査車両による複数回の走査データを用い、ピクセル単位の深度と一時的特徴ラベルを備えた大規模3Dマップを構築する。
  • 手動ラベル付けを一切行わず、事前に生成された深度および一時的特徴データを教師データとして用い、深層畳み込みネットワークを学習する。
  • 複数の視点における深度の一貫性をもとに、構造的エントロピーを計算することで一時的特徴を定義する。
  • 実行時、学習済みネットワークを用いて単一のモノクロナル画像から一時的特徴と深度を推論する。
  • 予測された一時的特徴マスクと深度を、単眼VOパイプラインに統合し、スパース特徴または密度のある光度マッチングを用いる。
  • 一時的特徴マスクを空間フィルタとして用い、運動推定の際、動的物体上に存在する特徴を除外する。

実験結果

リサーチクエスチョン

  • RQ1手動ラベル付けやセマンティッククラス定義なしに、自己教師ありの深層学習アプローチがピクセル単位の一時的特徴マスクを学習可能か?
  • RQ2学習済みの一時的特徴と深度が、大規模な動的交通が混在する都市部環境における単眼視覚オドメトリにどの程度向上効果をもたらすか?
  • RQ3大型の移動物体による遮蔽下でも、本手法はベースラインVOシステムと比較して、ずれと速度推定の正確性に優れているか?
  • RQ4画像の90%以上が独立して移動する車両に覆われた状態でも、本手法はロバストな運動推定を維持できるか?
  • RQ5標準的なVOと比較して、一時的特徴マスクの統合が、干渉要因が存在する状況で速度推定誤差を顕著に低減できるか?

主な発見

  • スパース一時的特徴を考慮したVOアプローチにより、オックスフォード・ロボットカー・データセットにおける400km走行の平均並進ずれが6.55%から6.38%に低下した。
  • 同様のアプローチにより、回転ずれは0.0353 deg/mから0.0321 deg/mに低下し、角度の安定性が向上した。
  • 干渉要因が存在する状況では、スパース一時的特徴を考慮したVOが、速度誤差を0.220 m/sから0.0489 m/sにまで低減(80%以上の改善)した。
  • 密度のある一時的特徴を考慮したVOでは、干渉要因が強いシーンで速度誤差が0.766 m/sから0.424 m/sに低下し、顕著なロバスト性を示した。
  • 一時的特徴マスクは、バス、トラック、歩行者など動的物体を、シーン全体が遮蔽されても正確に同定できた。
  • 本手法は、走行時における深度センシングや事前マップマッチングを一切必要とせず、単一のモノクロナルカメラでの計測スケールの視覚オドメトリを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。