Skip to main content
QUICK REVIEW

[论文解读] aiMotive Dataset: A Multimodal Dataset for Robust Autonomous Driving with Long-Range Perception

Tamás Matuszka, Iván Barton|arXiv (Cornell University)|Nov 17, 2022
Advanced Neural Network Applications被引用 7
一句话总结

本论文介绍了aiMotive数据集,这是一个多模态自动驾驶数据集,包含同步的激光雷达、摄像头和雷达传感器,覆盖360°视场,数据采集于高速公路、城市和郊区环境,涵盖白天、夜间和雨天条件。该数据集提供长达200米的扩展3D目标标注,支持远距离感知,并提供了基线模型,表明激光雷达、雷达和摄像头的多模态融合可提升检测性能,尤其在夜间和雨天等挑战性条件下表现更优。

ABSTRACT

Autonomous driving is a popular research area within the computer vision research community. Since autonomous vehicles are highly safety-critical, ensuring robustness is essential for real-world deployment. While several public multimodal datasets are accessible, they mainly comprise two sensor modalities (camera, LiDAR) which are not well suited for adverse weather. In addition, they lack far-range annotations, making it harder to train neural networks that are the base of a highway assistant function of an autonomous vehicle. Therefore, we introduce a multimodal dataset for robust autonomous driving with long-range perception. The dataset consists of 176 scenes with synchronized and calibrated LiDAR, camera, and radar sensors covering a 360-degree field of view. The collected data was captured in highway, urban, and suburban areas during daytime, night, and rain and is annotated with 3D bounding boxes with consistent identifiers across frames. Furthermore, we trained unimodal and multimodal baseline models for 3D object detection. Data are available at \url{https://github.com/aimotive/aimotive_dataset}.

研究动机与目标

  • 解决公开可用的、具有远距离3D目标标注的多模态自动驾驶数据集缺乏的问题。
  • 克服现有数据集缺乏雷达传感器且感知范围有限(通常小于100米)的局限性,特别是在恶劣天气和远距离高速公路场景下。
  • 通过提供跨帧一致的3D边界框标注,支持研究在远距离3D目标检测中实现鲁棒的多模态传感器融合。
  • 支持在多样化环境条件下,对单模态和多模态模型在3D目标检测与跟踪方面的开发与基准测试。
  • 促进对远距离感知系统的研究,这对于自动驾驶车辆的高速公路辅助功能至关重要。

提出的方法

  • 采集了176个场景,包含同步且校准的激光雷达、摄像头和雷达传感器,覆盖360°视场。
  • 在多样化条件下采集数据:高速公路、城市和郊区环境;白天、夜间和雨天天气。
  • 使用跨帧一致的对象标识符对所有场景进行3D边界框标注,以支持检测与跟踪任务。
  • 将标注范围扩展至距自车200米,显著超过大多数现有数据集的范围。
  • 训练并评估了单模态(仅激光雷达、仅摄像头)和多模态(激光雷达 + 摄像头 + 雷达)基线模型,用于3D目标检测。
  • 采用标准指标,包括AP(平均精度)、AP-R40和分类准确率,评估不同距离范围和条件下的性能。

实验结果

研究问题

  • RQ1激光雷达、摄像头和雷达的多模态融合在远距离感知场景中如何提升3D目标检测性能?
  • RQ2与仅使用激光雷达或仅使用摄像头的模型相比,集成雷达数据在恶劣天气(如雨天)和低光照条件(如夜间)下的性能增益如何?
  • RQ3检测性能在不同环境条件(高速公路、城市、夜间、雨天)和距离范围(0–60米、60–120米、120–200米)下如何变化?
  • RQ4仅使用摄像头的模型能否在远距离感知中实现可靠性能?其表现与基于激光雷达的基线模型相比如何?
  • RQ5传感器冗余和多模态融合对真实自动驾驶场景中鲁棒性与泛化能力的影响是什么?

主要发现

  • 多模态基线模型(激光雷达、雷达、摄像头)在[60–120]米范围内的AP-R40得分最高,达到0.656,优于仅激光雷达(0.624)和激光雷达+摄像头(0.618)的基线模型。
  • 在[120–200]米范围内,激光雷达+雷达+摄像头融合模型的AP-R40达到0.178,显著优于仅激光雷达模型(0.237),并在远距离区域表现出最强的鲁棒性。
  • 雷达集成显著提升了夜间(AP-R40:0.692 vs. 0.657,仅激光雷达)和雨天条件下的检测性能(AP-R40:0.389 vs. 0.302,仅激光雷达),证明其在恶劣天气中的价值。
  • 仅摄像头模型整体表现较差,在近场区域(<30米)的AP-R40仅为0.406,远距离区域则低于0.10,表明其在远距离感知中可靠性有限。
  • 多模态融合在所有距离范围和环境条件下均带来一致的性能提升,尤其在城市和夜间数据集上表现突出,凸显了传感器冗余的重要性。
  • 激光雷达+雷达+摄像头模型在[60–120]米范围内的分类准确率最高(0.790),AOS值为0.874,表明检测质量与置信度均得到提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。