Skip to main content
QUICK REVIEW

[論文レビュー] DeLS-3D: Deep Localization and Segmentation with a 3D Semantic Map

Peng Wang, Ruigang Yang|arXiv (Cornell University)|May 13, 2018
Robotics and Sensor-Based Localization参考文献 41被引用数 6
ひとこと要約

本論文では、RGB動画、GPS/IMU、および3次元セマンティックマップを用いて6自由度カメラポーズ推定とセマンティックセグメンテーションを統合的に実行する、統合的ディープラーニングフレームワークDeLS-3Dを提案する。ポーズCNNとRNNによる統合と精練により、レンダリングされたラベルマップをガイドとするセグメンテーションCNNを経て、リアルタイム性能(ポーズ推定10ms、セグメンテーション90ms)を達成し、ピクセル精度96%、サブデグリーのポーズ誤差を実現。ローカライゼーションとパーサーのタスクが相互に恩恵をもたらすことを示した。

ABSTRACT

For applications such as autonomous driving, self-localization/camera pose estimation and scene parsing are crucial technologies. In this paper, we propose a unified framework to tackle these two problems simultaneously. The uniqueness of our design is a sensor fusion scheme which integrates camera videos, motion sensors (GPS/IMU), and a 3D semantic map in order to achieve robustness and efficiency of the system. Specifically, we first have an initial coarse camera pose obtained from consumer-grade GPS/IMU, based on which a label map can be rendered from the 3D semantic map. Then, the rendered label map and the RGB image are jointly fed into a pose CNN, yielding a corrected camera pose. In addition, to incorporate temporal information, a multi-layer recurrent neural network (RNN) is further deployed improve the pose accuracy. Finally, based on the pose from RNN, we render a new label map, which is fed together with the RGB image into a segment CNN which produces per-pixel semantic label. In order to validate our approach, we build a dataset with registered 3D point clouds and video camera images. Both the point clouds and the images are semantically-labeled. Each video frame has ground truth pose from highly accurate motion sensors. We show that practically, pose estimation solely relying on images like PoseNet may fail due to street view confusion, and it is important to fuse multiple sensors. Finally, various ablation studies are performed, which demonstrate the effectiveness of the proposed system. In particular, we show that scene parsing and pose estimation are mutually beneficial to achieve a more robust and accurate system.

研究の動機と目的

  • 繰り返し構造や低テクスチャ環境など、視覚的に曖昧な条件下でも画像のみに依存する手法の限界を解消すること。
  • RGB画像、GPS/IMU、3次元セマンティックマップのマルチセンサデータ統合を通じて、屋外ロボットナビゲーションおよび拡張現実技術における耐障害性と精度を向上させること。
  • ポーズ推定とセマンティックセグメンテーションの両タスクが相互に補い合うように、クロスタスクの監視を統合した統合的ディープラーニングフレームワークを構築すること。
  • 高品質で現実世界のデータセットを構築・公開すること。その内容は、密度の高い3次元セマンティック点群、真値のカメラポーズ、ピクセル単位のセマンティックラベルを含む。
  • RNNによる時系列モデリングとレンダリングされたラベルマップのガイドが、ポーズ推定とセグメンテーションの両性能を顕著に向上させることを実証すること。

提案手法

  • 消費者向けGPS/IMUからの初期粗いカメラポーズを用い、3次元セマンティックマップから2次元セマンティックラベルマップをレンダリングする。
  • ポーズCNNがレンダリングされたラベルマップとRGB画像を統合し、セマンティックコンテキストを活用してカメラポーズを精練する。
  • マルチレイヤーRNNが精錬済みポーズの時系列を処理し、再帰的モデリングにより時間的整合性と精度を向上させる。
  • RNNからの最終的ポーズを用いて、より高精度なラベルマップを再レンダリングし、そのマップをRGB画像と統合してセグメンテーションCNNに供給し、ピクセル単位のセマンティックラベルを出力する。
  • ポーズ推定とセグメンテーションネットワークが相互に監視し合い、統合的なトレーニングと推論パイプラインを採用して同時に最適化する。
  • 高精度なRiegl LIDARを用いて3次元セマンティック点群を構築し、真値ポーズとピクセルレベルのラベルが同期された動画を含む、新規データセットを構築する。

実験結果

リサーチクエスチョン

  • RQ13次元セマンティックマップをRGB動画とGPS/IMU信号と統合することで、視覚的に曖昧な屋外環境におけるカメラローカライゼーションの耐障害性が顕著に向上するか?
  • RQ23次元マップからのセマンティックガイダンスが、画像のみに依存する手法と比較して、6自由度カメラポーズ推定の精度と整合性をどの程度向上させるか?
  • RQ3RNNを用いた時系列のポーズ推定精錬が、統合的ローカライゼーションとセグメンテーションフレームワークにおいて、どの程度有効であるか?
  • RQ4レンダリングされたセマンティックラベルマップを監視として用いることで、細分化されたオブジェクトやレアクラスのセグメンテーション性能が向上するか?
  • RQ5ポーズ推定とセマンティックセグメンテーションを同時に最適化することで、独立して処理する場合よりも優れた結果が得られるか?

主な発見

  • 1枚のTitan Z GPU上で、ポーズ推定の推論時間が10ms、512×608解像度の画像セグメンテーションが90msで実現され、リアルタイム性能を達成した。
  • RNNで精錬されたポーズを用いることで、都市部の困難な環境下でもポーズ推定誤差が1度未満に抑えられ、高い精度を示した。
  • モデル圧縮なしで96%のピクセル精度を達成。ポーズガイド付きのラベルマップを用いることで、境界の詳細とレアクラスの検出に顕著な向上が見られた。
  • アブレーションスタディでは、真値ポーズを用いてラベルマップをレンダリングした場合、ZparkデータセットでmIOUが73.10に上昇し、強力な上限性能を示した。
  • Zparkデータセットにおいて、RNNで精錬されたポーズを用いることで、ポーズCNN単体に比べてmIOUが10%向上し、特に柱や看板のような細い構造物の認識に顕著な恩恵があった。
  • 可視化結果から、ポーズ精錬によりずれや境界誤差が低減され、オブジェクトレイアウトの整合性と詳細回復に明確な改善が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。