[论文解读] DAIR-V2X: A Large-Scale Dataset for Vehicle-Infrastructure Cooperative 3D Object Detection
本论文提出了DAIR-V2X,这是首个大规模真实世界数据集,用于车路协同三维目标检测(VIC3D),包含来自城市和高速公路环境的71,254帧同步激光雷达与摄像头数据。该研究提出了一种时间补偿后融合(TCLF)框架,在平均检测精度上比单视角方法提升15%,同时缓解了时间不同步问题并降低了数据传输成本。
Autonomous driving faces great safety challenges for a lack of global perspective and the limitation of long-range perception capabilities. It has been widely agreed that vehicle-infrastructure cooperation is required to achieve Level 5 autonomy. However, there is still NO dataset from real scenarios available for computer vision researchers to work on vehicle-infrastructure cooperation-related problems. To accelerate computer vision research and innovation for Vehicle-Infrastructure Cooperative Autonomous Driving (VICAD), we release DAIR-V2X Dataset, which is the first large-scale, multi-modality, multi-view dataset from real scenarios for VICAD. DAIR-V2X comprises 71254 LiDAR frames and 71254 Camera frames, and all frames are captured from real scenes with 3D annotations. The Vehicle-Infrastructure Cooperative 3D Object Detection problem (VIC3D) is introduced, formulating the problem of collaboratively locating and identifying 3D objects using sensory inputs from both vehicle and infrastructure. In addition to solving traditional 3D object detection problems, the solution of VIC3D needs to consider the temporal asynchrony problem between vehicle and infrastructure sensors and the data transmission cost between them. Furthermore, we propose Time Compensation Late Fusion (TCLF), a late fusion framework for the VIC3D task as a benchmark based on DAIR-V2X. Find data, code, and more up-to-date information at https://thudair.baai.ac.cn/index and https://github.com/AIR-THU/DAIR-V2X.
研究动机与目标
- 解决车路协同自动驾驶(VICAD)研究中缺乏真实世界数据集的问题。
- 提出车路协同三维目标检测(VIC3D)任务,以支持利用多视角、多模态数据进行协同感知。
- 应对VIC3D中的关键挑战,包括车辆与基础设施传感器之间的时间不同步问题以及高昂的数据传输成本。
- 提供一个基准评估框架,用于在真实通信约束条件下评估和比较不同融合策略。
- 利用真实世界数据,推动对协同感知系统中性能-带宽权衡关系的研究。
提出的方法
- 从真实路口、高速公路和城市道路采集71,254帧同步的激光雷达与摄像头数据,并附带三维边界框标注。
- 将数据集划分为三个子集:DAIR-V2X-C(协同感知)、DAIR-V2X-V(仅车辆)和DAIR-V2X-I(仅基础设施),以支持多样化的评估场景。
- 将VIC3D任务定义为一种利用车辆与基础设施传感器输入的协同三维检测问题。
- 提出时间补偿后融合(TCLF)框架,通过时间感知的特征补偿机制,对齐时间不同步的传感器数据。
- 在DAIR-V2X-V和DAIR-V2X-I上实现基线模型,采用MMDetection3D框架,包括ImvoxelNet、PointPillars、SECOND和MVXNet,用于单模态与多模态检测。
- 使用PASCAL VOC风格的评估指标,在Easy、Moderate和Hard三种难度级别下进行性能评估,其中车辆的IoU阈值为0.5,行人与自行车的IoU阈值为0.25。

实验结果
研究问题
- RQ1与仅依赖车辆感知相比,整合基础设施侧感知数据在三维目标检测性能上提升了多少?
- RQ2车辆与基础设施传感器之间的时间不同步在多大程度上降低了检测精度?该问题能否被有效缓解?
- RQ3在协同三维检测中,早期融合与后融合策略之间的性能-带宽权衡关系如何?
- RQ4后融合框架是否能有效补偿传感器数据流中的时间延迟,而无需传输完整的点云数据?
- RQ5在真实城市环境中,不同融合策略在不同环境条件和物体类别下的表现如何?
主要发现
- 与仅车辆感知相比,整合基础设施传感器数据使各类物体的平均精度(AP)平均提升15%。
- 后融合方法的AP比单视角检测器高出10–20个百分点,证明了多视角协作的优势。
- 在鸟瞰图(BEV)和三维检测基准中,早期融合的AP最高比后融合高出8%,但其数据传输量是后融合的4,000倍。
- 所提出的TCLF框架能有效缓解时间不同步问题,尤其在时间延迟较大的情况下,定量结果与可视化分析均验证了其有效性。
- 在DAIR-V2X-I(仅基础设施)数据集上,MVXNet在车辆检测中达到71.04% AP(Easy),行人检测为55.83%(Easy),自行车检测为54.05%(Easy),表明基础设施侧感知性能优异。
- 在DAIR-V2X-V(仅车辆)数据集上,MVXNet在车辆检测中达到69.86% AP(Easy),行人检测为47.73%(Easy),自行车检测为45.68%(Easy),证实了从车辆侧传感器实现高精度检测的可行性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。