Skip to main content
QUICK REVIEW

[論文レビュー] Crowdsourced 3D Mapping: A Combined Multi-View Geometry and Self-Supervised Learning Approach

Hemang Chawla, Matti Jukola|arXiv (Cornell University)|Jul 25, 2020
Robotics and Sensor-Based Localization参考文献 48被引用数 7
ひとこと要約

本論文は、単眼RGB動画とGPSデータからカメラ内パラメータの事前知識が不要な3次元交通標識マッピングフレームワークを提案する。このフレームワークは、マルチビュー幾何学と自己教師付き深層学習を統合し、カメラ内パラメータ、深度、自己移動量を推定する。この手法により、カメラパラメータの事前知識がなくても正確な3次元標識位置推定が可能となる。全シーケンスにおいて平均相対位置誤差0.39 m、平均絶対誤差1.26 mを達成し、既存手法に比べ、既知の内パラメータや追加センサを必要としない点で優れている。

ABSTRACT

The ability to efficiently utilize crowdsourced visual data carries immense potential for the domains of large scale dynamic mapping and autonomous driving. However, state-of-the-art methods for crowdsourced 3D mapping assume prior knowledge of camera intrinsics. In this work, we propose a framework that estimates the 3D positions of semantically meaningful landmarks such as traffic signs without assuming known camera intrinsics, using only monocular color camera and GPS. We utilize multi-view geometry as well as deep learning based self-calibration, depth, and ego-motion estimation for traffic sign positioning, and show that combining their strengths is important for increasing the map coverage. To facilitate research on this task, we construct and make available a KITTI based 3D traffic sign ground truth positioning dataset. Using our proposed framework, we achieve an average single-journey relative and absolute positioning accuracy of 39cm and 1.26m respectively, on this dataset.

研究の動機と目的

  • 消費者用センサを用いて、事前キャリブレーションが不要な大規模でコスト効率の良い3次元交通標識マッピングを実現すること。
  • クラウドソーシングされた視覚データにおける未知または変動するカメラ内パラメータの課題を、3次元再構築において解決すること。
  • マルチビュー幾何学と深層学習に基づく自己キャリブレーション、深度、自己移動量推定を統合することで、マップカバレッジと精度を向上させること。
  • 将来のクラウドソーシングマッピング手法のベンチマーク化を可能とする、公開可能なKITTIベースの3次元交通標識の真値データセットを提供すること。

提案手法

  • フレームワークは、キャリブレート済みセンサやIMUに依存しない、単眼RGB画像とGPSデータを入力として使用する。
  • 構造からモード(SfM)とボンズ調整を用いた自己キャリブレーションおよび自己移動量推定のため、マルチビュー幾何学的手法(例:COLMAP)を適用する。
  • 自己教師付き深層学習モデル(Monodepth2とVITW)を用いて、真値深度が不要な単眼深度および自己移動量推定を実施する。
  • 幾何学的トラッキング(ORB-SLAM、ループクロージャー有無あり)と学習済み深度マップを統合したハイブリッドアプローチにより、交通標識の3次元位置を三角測量で推定する。
  • 複数の視点を用いた三角測量により標識位置を推定し、自己キャリブレーションの結果を用いてカメラ投影行列を最適化する。
  • 相対誤差および絶対誤差を用いて、全シーケンスにわたる性能評価を実施し、キャリブレーションおよび推定手法に関するアブレーションスタディも実施する。

実験結果

リサーチクエスチョン

  • RQ1カメラ内パラメータが未知である場合、3次元交通標識の三角測量精度は自己キャリブレーションの精度にどの程度依存するか?
  • RQ2クラウドソーシングマッピングにおいて、幾何学的手法と深層学習手法の自己キャリブレーション、深度推定、自己移動量推定の性能を比較するとどうなるか?
  • RQ3マルチビュー幾何学と自己教師付き学習を統合したハイブリッドフレームワークは、純粋な幾何学的または学習ベースの手法に比べ、マップカバレッジと3次元標識局所化精度を向上させられるか?
  • RQ4IMUや既知の内パラメータを用いるシステムと比較して、単眼視覚に加えてGPSのみを用いる場合、3次元標識位置推定精度にどのような差が生じるか?

主な発見

  • 提案フレームワークは、全シーケンスにおいて平均相対3次元交通標識位置誤差0.39 m、平均絶対誤差1.26 mを達成し、既知のカメラ内パラメータがなくても高い精度を示した。
  • ORB-SLAMにループクロージャーを組み合わせ、COLMAPによる自己キャリブレーションを適用したアプローチが、相対位置誤差0.24 m(1標識あたり正規化済み)という最良の相対位置精度を達成した。
  • トラッキング失敗が生じたシーケンス(例:Seq 1)では、深度推定にMonodepth2、キャリブレーションにCOLMAPを用いたアプローチBが最良の誤差(相対誤差0.58 m)を示し、困難な条件下でも耐性があることを示した。
  • COLMAPまたはVITW(m)による自己キャリブレーションの導入は、キャリブレーションなしの状況と比較して、標識位置推定精度を顕著に向上させた。これにより、内パラメータ推定の重要性が確認された。
  • ハイブリッドフレームワークは、純粋な幾何学的または純粋な深層学習的手法を上回る性能を示し、特に長距離トラジェクトリーや特徴が乏しい環境で顕著であった。
  • 公開されたKITTIベースの3次元交通標識真値データセットにより、将来のクラウドソーシングマッピング手法の再現可能で標準化された評価とベンチマークが可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。