Skip to main content
QUICK REVIEW

[论文解读] Project AutoVision: Localization and 3D Scene Perception for an Autonomous Vehicle with a Multi-Camera System

Lionel Heng, Benjamin Choi|arXiv (Cornell University)|Sep 14, 2018
Robotics and Sensor-Based Localization参考文献 26被引用 12
一句话总结

Project AutoVision 展示了一种仅使用摄像头的系统,用于自动驾驶车辆的定位与三维场景感知,采用多鱼眼摄像头配置,集成近红外(NIR)和彩色传感器。该系统实现了实时视觉-惯性里程计、在已映射和未映射区域中无需 GNSS 的定位(利用卫星影像和三维地图),以及通过 TSDF 融合实现的密集三维重建,城市环境下的中位定位误差为 1.84m(位置)和 1.9°(航向)。

ABSTRACT

Project AutoVision aims to develop localization and 3D scene perception capabilities for a self-driving vehicle. Such capabilities will enable autonomous navigation in urban and rural environments, in day and night, and with cameras as the only exteroceptive sensors. The sensor suite employs many cameras for both 360-degree coverage and accurate multi-view stereo; the use of low-cost cameras keeps the cost of this sensor suite to a minimum. In addition, the project seeks to extend the operating envelope to include GNSS-less conditions which are typical for environments with tall buildings, foliage, and tunnels. Emphasis is placed on leveraging multi-view geometry and deep learning to enable the vehicle to localize and perceive in 3D space. This paper presents an overview of the project, and describes the sensor suite and current progress in the areas of calibration, localization, and perception.

研究动机与目标

  • 仅使用摄像头作为唯一外部感知传感器,实现自动驾驶车辆中鲁棒的视觉定位与三维场景感知。
  • 将系统工作范围扩展至已映射区域之外及依赖 GNSS 的环境,包括城市、乡村和低光照环境。
  • 利用多视角几何与深度学习,实现实时视觉-惯性里程计、无 GNSS 定位与密集三维制图。
  • 开发一个完全集成的系统,具备自动标定与实时处理能力,可部署于量产车辆平台。

提出的方法

  • 采用 16 个鱼眼摄像头(4 个彩色,12 个 NIR)安装于车辆顶部的多摄像头系统,提供 360° 视野与高垂直分辨率。
  • 通过 GPU 加速的平面扫掠立体匹配技术实现多摄像头配置下的实时视觉-惯性里程计,用于深度估计。
  • 在未映射区域中实现无 GNSS 定位,利用地理配准的卫星影像与已知初始位姿;在已映射区域中,使用稀疏三维地图,无需预先知晓位姿。
  • 通过平面扫掠立体匹配生成的深度图像与截断符号距离函数(TSDF)融合,实现密集三维制图,并利用基于 YOLOv3 的 2D 检测技术动态移除物体。
  • 系统采用自动标定方法对多传感器套件(包括摄像头、IMU 和 GNSS)进行对齐与精度校准,确保系统一致性。
  • 所有模块集成于一个运行在车辆平台上的实时软件栈,处理频率为 15–20 Hz。

实验结果

研究问题

  • RQ1多摄像头系统是否能在无 LiDAR 或 GNSS 的情况下实现精确的视觉-惯性里程计与三维场景感知?
  • RQ2如何仅利用摄像头与卫星影像实现在已映射与未映射环境中的无 GNSS 定位?
  • RQ3在复杂的城市与乡村环境中,使用鱼眼摄像头与 TSDF 融合技术进行实时密集三维制图的性能如何?
  • RQ4基于 2D 目标检测在识别动态物体方面是否有效,能否防止三维重建过程中的地图伪影?
  • RQ5全摄像头系统是否能在多样化的光照与环境条件下实现鲁棒的定位与感知?

主要发现

  • 在城市环境中,系统实现的中位定位误差为 1.84m(位置)与 1.9°(航向),平均误差分别为 3.31m 与 2.6°。
  • 在乡村环境中,中位误差为 1.81m(位置)与 3.3°(航向),平均误差分别为 3.48m 与 4.2°。
  • 平面扫掠立体匹配在前五台摄像头以半分辨率下运行于 15 Hz,实现了从去畸变鱼眼图像中实时估计深度。
  • 三维制图流水线使用 InfiniTAM 库,运行频率约为 20 Hz,能够从融合的深度图像生成高保真度的 TSDF 体素。
  • 通过微调的 YOLOv3 实现的动态物体检测能有效遮蔽移动物体,防止在重建的三维场景中产生地图伪影。
  • 系统在低光照条件下通过 NIR 摄像头与补光装置成功运行,保持了图像质量与深度估计的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。