Skip to main content
QUICK REVIEW

[論文レビュー] Project AutoVision: Localization and 3D Scene Perception for an Autonomous Vehicle with a Multi-Camera System

Lionel Heng, Benjamin Choi|arXiv (Cornell University)|Sep 14, 2018
Robotics and Sensor-Based Localization参考文献 26被引用数 12
ひとこと要約

Project AutoVisionは、NIRおよびカラーセンサを備えたマルチフィッシュアイカメラセットアップを用いて、カメラオンリーシステムとして自律走行車両の局所化と3次元シーン認識を実現する。リアルタイムの視覚慣性オドメトリ、地図あり・なしの両方の領域における衛星画像および3次元地図を用いたGNSS非依存の局所化、TSDF融合による高密度3次元再構成を達成し、都市部における中央値の局所化誤差は位置で1.84m、方位角で1.9°である。

ABSTRACT

Project AutoVision aims to develop localization and 3D scene perception capabilities for a self-driving vehicle. Such capabilities will enable autonomous navigation in urban and rural environments, in day and night, and with cameras as the only exteroceptive sensors. The sensor suite employs many cameras for both 360-degree coverage and accurate multi-view stereo; the use of low-cost cameras keeps the cost of this sensor suite to a minimum. In addition, the project seeks to extend the operating envelope to include GNSS-less conditions which are typical for environments with tall buildings, foliage, and tunnels. Emphasis is placed on leveraging multi-view geometry and deep learning to enable the vehicle to localize and perceive in 3D space. This paper presents an overview of the project, and describes the sensor suite and current progress in the areas of calibration, localization, and perception.

研究の動機と目的

  • カメラを唯一の外部センサとして用いることで、自律走行車両における耐障害性の高い視覚的局所化と3次元シーン認識を実現すること。
  • 地図あり領域やGNSS依存の条件にとどまらない、都市部、地方部、低照度環境を含む広範な環境での運用範囲を拡張すること。
  • マルチビュー幾何学とディープラーニングを用いて、リアルタイムの視覚慣性オドメトリ、GNSS非依存の局所化、高密度3次元マッピングを達成すること。
  • 自動キャリブレーションとリアルタイム処理を備えた完全統合型システムを構築し、量産車両プラットフォームへの実装を可能にすること。

提案手法

  • 車両屋根に取り付けられた16台のフィッシュアイカメラ(4台のカラーモジュール、12台のNIRモジュール)により、360°のカバー範囲と高い垂直分解能を実現するマルチカメラシステム。
  • GPUアクセラレーションを用いた平面スイープステレオによる深度推定を活用し、マルチカメラ構成でリアルタイムの視覚慣性オドメトリを実装。
  • 地図なし領域におけるGNSS非依存の局所化には、地理的に位置付けられた衛星画像と既知の初期ポーズを用い、地図あり領域では事前のポーズ知識なしにスパarsな3次元地図を活用。
  • 平面スイープステレオからの深度画像をTSDF(切断された符号付き距離関数)融合により統合することで高密度3次元マッピングを実現し、YOLOv3ベースの2次元検出を用いて動的物体を除去。
  • カメラ、IMU、GNSSを含むマルチセンサの自動キャリブレーションにより、アライメントと正確性を確保。
  • すべてのモジュールが、車両プラットフォーム上で15–20 Hzで実行されるリアルタイムソフトウェアスタックに統合されている。

実験結果

リサーチクエスチョン

  • RQ1マルチカメラシステムは、LiDAR や GNSS を使用せずに、正確な視覚慣性オドメトリと3次元シーン認識を達成できるか?
  • RQ2カメラと衛星画像のみを用いて、地図あり・地図なしの両方の環境でGNSS非依存の局所化をどのように実現できるか?
  • RQ3複雑な都市部および地方部の環境において、フィッシュアイカメラとTSDF融合を用いたリアルタイムの高密度3次元マッピングの性能はどの程度か?
  • RQ42次元物体検出は、3次元再構成中のマップアーチファクトを防ぐために、動的物体を効果的に特定できるか?
  • RQ5完全にカメラベースのシステムは、多様な照度条件や環境条件下でも耐障害性の高い局所化と認識を達成できるか?

主な発見

  • 都市部では、中央値の局所化誤差が位置で1.84m、方位角で1.9°であり、平均誤差はそれぞれ3.31mと2.6°であった。
  • 地方部では、中央値の誤差は位置で1.81m、方位角で3.3°であり、平均誤差はそれぞれ3.48mと4.2°であった。
  • 平面スイープステレオは、前方5台のカメラについて半分解像度で15 Hzで実行され、歪みのないフィッシュアイ画像からのリアルタイム深度推定を可能にした。
  • InfiniTAMライブラリを用いて3次元マッピングパイプラインは約20 Hzで実行され、融合された深度画像から高精細なTSDFボリュームが生成された。
  • 微調整されたYOLOv3を用いた動的物体検出により、移動物体が効果的にマスクされ、再構成された3次元シーンにアーチファクトが生じにくくなった。
  • NIRカメラとイリュミネーターを用いることで、低照度条件下でも画像品質と深度推定の正確性を維持し、システムが正常に動作した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。