[论文解读] LiDAR Cluster First and Camera Inference Later: A New Perspective Towards Autonomous Driving
本文提出了一种新颖的端到端自动驾驶感知流程,通过首先将LiDAR点云聚类为3D簇,再将其投影到2D相机区域(形成2D簇),最后仅在这些优先处理的区域上应用基于相机的推理,从而优先处理高风险物体。该方法减少了优先级倒置现象,相比全帧处理,推理速度提升了25%,且在Waymo开放数据集上保持了相近的检测精度。
Object detection in state-of-the-art Autonomous Vehicles (AV) framework relies heavily on deep neural networks. Typically, these networks perform object detection uniformly on the entire camera LiDAR frames. However, this uniformity jeopardizes the safety of the AV by giving the same priority to all objects in the scenes regardless of their risk of collision to the AV. In this paper, we present a new end-to-end pipeline for AV that introduces the concept of LiDAR cluster first and camera inference later to detect and classify objects. The benefits of our proposed framework are twofold. First, our pipeline prioritizes detecting objects that pose a higher risk of collision to the AV, giving more time for the AV to react to unsafe conditions. Second, it also provides, on average, faster inference speeds compared to popular deep neural network pipelines. We design our framework using the real-world datasets, the Waymo Open Dataset, solving challenges arising from the limitations of LiDAR sensors and object detection algorithms. We show that our novel object detection pipeline prioritizes the detection of higher risk objects while simultaneously achieving comparable accuracy and a 25% higher average speed compared to camera inference only.
研究动机与目标
- 解决自动驾驶车辆感知系统中的优先级倒置问题,即所有物体均被统一处理,尽管其碰撞风险各不相同。
- 通过仅聚焦于相机帧中最重要的区域,减少计算资源浪费。
- 设计一种与真实世界兼容的流程,避免依赖理想化的边界框或完美的LiDAR标注。
- 在实时自动驾驶应用中实现更快的推理速度,同时不牺牲检测精度。
- 通过基于深度的复合图像分组与优化,实现高效的GPU资源利用。
提出的方法
- 在原始LiDAR点云上使用Depth Clustering算法,基于深度不连续性对3D物体进行分割。
- 将3D簇投影到2D相机图像上,生成带有深度值的2D簇。
- 应用一种基于深度的合并算法,将重叠或分散的2D簇合并为碰撞规避区域(CAZones)。
- 设计一种基于深度的First-Fit Decreasing Height(FFDH)算法,将CAZones分组为复合图像,以实现高效的GPU批处理。
- 通过GPU性能分析和基于深度的优先级排序优化流程,控制优先级倒置并降低端到端延迟。
- 在Waymo开放数据集上使用YOLOv3对复合CAZones进行推理评估。
实验结果
研究问题
- RQ1是否可以通过以LiDAR为先、相机推理为后的流程,聚焦于高风险区域,从而减少自动驾驶感知中的优先级倒置?
- RQ2与全帧相机推理相比,所提出方法在推理速度和检测精度方面表现如何?
- RQ3是否可以有效利用真实世界的LiDAR数据生成可靠、具有深度感知的感兴趣区域,而无需依赖完美的边界框假设?
- RQ4基于深度的合并与复合图像分组在多大程度上能提升GPU利用率并降低端到端延迟?
- RQ5尽管仅处理相机帧的子集,该流程是否仍能保持或提升检测精度?
主要发现
- 所提流程的平均推理时间为129 ms,比全帧YOLOv3-608基线(197 ms)快25%。
- LiDAR模块平均处理点云耗时5.7 ms,相机模块的非推理组件仅增加9 ms开销。
- 该方法保持了相近的检测精度,mAP为92.73%(高于全帧608基线的90.75%),AP_{50}为96.25%。
- 基于深度的合并算法成功减少了误报和过度分割的簇,形成了连贯的CAZones,有利于有效推理。
- 复合图像分组策略实现了高效的GPU批处理,显著提升了整体速度,且无需修改DNN架构。
- 系统在Waymo开放数据集的真实世界条件下表现出鲁棒性,且不依赖理想化或合成的LiDAR标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。