[论文解读] TUMTraf V2X Cooperative Perception Dataset
本论文提出了 TUMTraf-V2X,一个大规模的V2X协同感知数据集,包含2,000个标注的点云和来自五个路边传感器及四个车载传感器的5,000张图像,涵盖30,000个带有轨迹ID的3D边界框,场景具有挑战性,如近距离接触和U型转弯。该研究提出 CoopDet3D 模型,一种多模态摄像头-LiDAR 融合方法,在仅使用车辆传感器的感知基础上实现了 +14.36 的3D mAP提升,并公开发布数据集、标注工具、开发工具包和代码以供公众使用。
Cooperative perception offers several benefits for enhancing the capabilities of autonomous vehicles and improving road safety. Using roadside sensors in addition to onboard sensors increases reliability and extends the sensor range. External sensors offer higher situational awareness for automated vehicles and prevent occlusions. We propose CoopDet3D, a cooperative multi-modal fusion model, and TUMTraf-V2X, a perception dataset, for the cooperative 3D object detection and tracking task. Our dataset contains 2,000 labeled point clouds and 5,000 labeled images from five roadside and four onboard sensors. It includes 30k 3D boxes with track IDs and precise GPS and IMU data. We labeled eight categories and covered occlusion scenarios with challenging driving maneuvers, like traffic violations, near-miss events, overtaking, and U-turns. Through multiple experiments, we show that our CoopDet3D camera-LiDAR fusion model achieves an increase of +14.36 3D mAP compared to a vehicle camera-LiDAR fusion model. Finally, we make our dataset, model, labeling tool, and dev-kit publicly available on our website: https://tum-traffic-dataset.github.io/tumtraf-v2x.
研究动机与目标
- 为解决缺乏高质量、真实世界V2X感知数据集的问题,这些数据集能够支持基于基础设施和车辆传感器的协同3D目标检测与跟踪。
- 通过融合路边和车载传感器数据,提升情境感知能力并减少遮挡,以支持自动驾驶。
- 开发一种鲁棒的多模态协同检测模型,其性能优于单视角感知系统。
- 通过发布标准化数据集、标注工具和开发工具包(OpenLABEL格式),实现可复现的研究。
- 通过提供涵盖夜间场景和交通违规行为等多样化交通条件下的数据,支持未来在协同感知领域的研究。
提出的方法
- 数据集采集自德国一个真实城市交叉路口,使用五个路边传感器和四个车载传感器,包括激光雷达、摄像头、GPS和IMU。
- 在2,000个点云和5,000张图像中,对八类物体标注了带有轨迹ID的3D边界框,共涵盖30,000个实例。
- 开发了专用的3D边界框标注工具(3D BAT v24.3.2),用于标注多模态V2X数据。
- CoopDet3D 是一个三阶段融合模型:(1) 通过鸟瞰图(BEV)特征提取实现路边摄像头-LiDAR 融合,(2) 使用卷积融合器实现车载摄像头-LiDAR 融合,(3) 通过最大池化操作融合车载与基础设施特征。
- 模型采用 TransFusion 3D 检测头生成最终的3D边界框预测结果。
- 提供开发工具包,支持以 OpenLABEL 格式加载、可视化、转换和评估标注,实现与现有工具的无缝集成。

实验结果
研究问题
- RQ1与仅使用车辆传感器的感知相比,利用路边和车辆传感器进行协同感知在3D目标检测性能上提升多少?
- RQ2来自基础设施和车辆视角的多模态融合(摄像头与激光雷达)对检测精度有何影响?
- RQ3CoopDet3D 模型在多样化交通场景(包括遮挡和近似碰撞事件)中的泛化能力如何?
- RQ4标准化的开源数据集和工具链是否能够实现可复现且可扩展的协同V2X感知研究?
- RQ5当前协同感知模型在处理传感器异步性和实时部署约束方面存在哪些局限性?
主要发现
- 与仅使用车辆摄像头-LiDAR 融合的模型相比,CoopDet3D 在3D mAP上提升了+14.36,证明了基于基础设施感知的优势。
- 该模型在白天和夜间条件下均优于单视角基线模型,包括交通违规和严重遮挡等复杂场景。
- 基于跨模态Transformer的 CoopCMT 模型在mAP上优于 CoopDet3D,但因模型复杂度更高,推理延迟也相应增加。
- 数据集包含2,000个点云和5,000张图像,共30,380个3D边界框,涵盖8类物体和10种多样的交通操作行为。
- 开发工具包支持完整流水线功能,包括标签转换、可视化和以 OpenLABEL 标准格式进行评估。
- 失败案例揭示了恶劣天气和传感器异步性带来的挑战,提示未来需加强鲁棒性与实时同步机制的研究。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。