Skip to main content
QUICK REVIEW

[论文解读] 3D Visual Perception for Self-Driving Cars using a Multi-Camera System: Calibration, Mapping, Localization, and Obstacle Detection

Christian Häne, Lionel Heng|arXiv (Cornell University)|Aug 31, 2017
Robotics and Sensor-Based Localization参考文献 36被引用 4
一句话总结

本文提出了一种使用四鱼眼相机系统的全视觉3D感知流水线,用于自动驾驶汽车,实现了最小重叠的360°全覆盖。通过直接处理未畸变的鱼眼图像,避免了针孔投影的去畸变处理,同时保持了全景视野,在单张NVIDIA GTX 680 GPU上实现了高精度与实时性能,完成了精确标定、稀疏与稠密3D制图、实时视觉定位以及亚10厘米障碍物检测。

ABSTRACT

Cameras are a crucial exteroceptive sensor for self-driving cars as they are low-cost and small, provide appearance information about the environment, and work in various weather conditions. They can be used for multiple purposes such as visual navigation and obstacle detection. We can use a surround multi-camera system to cover the full 360-degree field-of-view around the car. In this way, we avoid blind spots which can otherwise lead to accidents. To minimize the number of cameras needed for surround perception, we utilize fisheye cameras. Consequently, standard vision pipelines for 3D mapping, visual localization, obstacle detection, etc. need to be adapted to take full advantage of the availability of multiple cameras rather than treat each camera individually. In addition, processing of fisheye images has to be supported. In this paper, we describe the camera calibration and subsequent processing pipeline for multi-fisheye-camera systems developed as part of the V-Charge project. This project seeks to enable automated valet parking for self-driving cars. Our pipeline is able to precisely calibrate multi-camera systems, build sparse 3D maps for visual navigation, visually localize the car with respect to these maps, generate accurate dense maps, as well as detect obstacles based on real-time depth map extraction.

研究动机与目标

  • 开发一种仅使用摄像头的低成本、高精度3D视觉感知流水线,用于自动驾驶代客泊车。
  • 利用鱼眼镜头实现最小重叠的360°环境感知。
  • 避免将图像去畸变为针孔模型,以保留完整视场并减少畸变导致的信息损失。
  • 通过多相机系统实现实时障碍物检测、定位与制图性能。
  • 证明纯视觉多鱼眼相机系统在低速自动驾驶任务中的可行性。

提出的方法

  • 系统采用基于结构的标定方法,利用多帧之间的2D-3D特征对应关系,估计每个鱼眼相机相对于车辆轮速里程计坐标系的外参。
  • 通过多相机联合优化运动模型,实现自运动估计,相比单个相机处理,显著提升了结果的一致性与准确性。
  • 稀疏3D地图通过基于特征的SLAM构建,而稠密3D地图则通过一种新颖的高度图融合技术,将多鱼眼相机的深度图进行融合生成。
  • 利用标定后的多相机系统,直接从鱼眼图像中估计深度图,避免了针孔投影模型带来的畸变。
  • 障碍物检测在2D空间中进行:通过深度图生成占据网格,沿射线提取障碍物,并在相机与时间维度上融合结果以降低噪声。
  • 所有处理均通过GPU加速进行优化,在单张NVIDIA GTX 680上实现了12.5Hz的处理速度。

实验结果

研究问题

  • RQ1是否能够通过重叠极少的多鱼眼相机系统,在不将图像去畸变为针孔投影的前提下,实现完整的360°环境感知?
  • RQ2如何在无需外部基础设施的条件下,实现高精度且高效的多相机标定?
  • RQ3能否通过融合具有强畸变的多鱼眼相机深度图,可靠地生成稠密3D地图?
  • RQ4如何仅利用鱼眼相机数据实现实时、高精度的障碍物检测?
  • RQ5在低速条件下,仅使用四相机鱼眼系统,视觉定位与制图在多大程度上能够实现鲁棒运行?

主要发现

  • 基于结构的标定方法仅依赖多帧间的2D-3D特征对应关系,即可实现高精度与高可重复性,无需特殊标定目标或外部基础设施。
  • 该系统通过多相机联合几何一致性约束,实现了精确的视觉定位与制图。
  • 采用密集高度图融合方法,结合重叠极少的多鱼眼相机数据,生成了准确且一致的3D模型。
  • 障碍物检测在单张NVIDIA GTX 680上实现了12.5Hz的实时处理,亚10厘米误差,通过时间与空间维度上的障碍物地图融合有效降低了噪声。
  • 整个流水线避免了将鱼眼图像去畸变为针孔模型,完整保留了视场,同时维持了更高的可用分辨率与信息量。
  • 该系统已在真实室内停车场环境中完成演示,验证了其在低速场景下实现自动代客泊车与充电的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。