[论文解读] OPV2V: An Open Benchmark Dataset and Fusion Pipeline for Perception with Vehicle-to-Vehicle Communication
本文提出了OPV2V,这是首个用于基于激光雷达和协同通信的车对车(V2V)感知的大规模开放基准数据集与融合流程。该工作提出了一种注意力中间融合方法,利用注意力机制融合来自多辆联网车辆的特征,在高达4096倍压缩率下仍能实现最先进水平的3D目标检测性能,显著降低带宽需求的同时保持高精度。
Employing Vehicle-to-Vehicle communication to enhance perception performance in self-driving technology has attracted considerable attention recently; however, the absence of a suitable open dataset for benchmarking algorithms has made it difficult to develop and assess cooperative perception technologies. To this end, we present the first large-scale open simulated dataset for Vehicle-to-Vehicle perception. It contains over 70 interesting scenes, 11,464 frames, and 232,913 annotated 3D vehicle bounding boxes, collected from 8 towns in CARLA and a digital town of Culver City, Los Angeles. We then construct a comprehensive benchmark with a total of 16 implemented models to evaluate several information fusion strategies~(i.e. early, late, and intermediate fusion) with state-of-the-art LiDAR detection algorithms. Moreover, we propose a new Attentive Intermediate Fusion pipeline to aggregate information from multiple connected vehicles. Our experiments show that the proposed pipeline can be easily integrated with existing 3D LiDAR detectors and achieve outstanding performance even with large compression rates. To encourage more researchers to investigate Vehicle-to-Vehicle perception, we will release the dataset, benchmark methods, and all related codes in https://mobility-lab.seas.ucla.edu/opv2v/.
研究动机与目标
- 为解决缺乏大规模、公开可用的数据集以用于基准测试V2V感知算法的问题。
- 在标准化基准上系统评估多车融合策略(早期、晚期和中间融合)。
- 开发并验证一种新型注意力中间融合流程,以在带宽受限条件下提升检测精度。
- 发布全面的数据集、基准代码和模型,以加速自动驾驶协同感知领域的研究。
提出的方法
- 作者使用CARLA和库佛城的数字孪生模型创建了大规模模拟数据集,包含73个场景、11,464帧以及232,913个3D车辆标注。
- 他们实现了16种模型,结合了最先进3D激光雷达检测器(如VoxelNet、PIXOR)与不同融合策略:早期、晚期和中间融合。
- 所提出的注意力中间融合流程利用自注意力机制动态加权并聚合来自多辆联网车辆的中间特征。
- 采用可学习的编码器-解码器架构对特征图进行压缩,实现在高达4096倍压缩率下仅造成极小的精度损失。
- 基准使用IoU阈值为0.5和0.7时的平均精度(AP)评估性能,并为CARLA城镇和库佛城分别设置独立的测试集,以评估域偏移影响。
- 所有模型均使用4块RTX 3090 GPU、Adam优化器配合早停策略进行训练,完整代码库已公开发布。

实验结果
研究问题
- RQ1在真实遮挡条件下,不同融合策略(早期、晚期和中间)的V2V感知性能如何变化?
- RQ2与早期和晚期融合相比,采用注意力机制的中间融合在高数据压缩率下能多大程度上提升检测精度?
- RQ3在严重遮挡的复杂城市交叉路口中,联网车辆数量(CAVs)如何影响检测性能?
- RQ4在V2V通信中,数据压缩率与检测精度之间的权衡如何?轻量化流程是否能在极端压缩率下维持高性能?
- RQ5在合成CARLA环境与真实世界启发的数字城镇(库佛城)之间的域偏移,如何影响模型泛化能力与性能?
主要发现
- 所提出的注意力中间融合流程在所有测试模型中于IoU=0.7时实现了最高的平均精度(AP),优于早期和晚期融合策略。
- 即使在4096倍压缩率下,注意力中间融合方法仍保持接近最先进水平的性能,AP仅下降3%,显著优于相同条件下的早期和晚期融合。
- 增加四辆联网车辆已带来显著的检测增益,超过四辆车后增益趋于饱和,原因在于盲区的视点覆盖已足够。
- 在真实世界启发的库佛城数据集上,性能普遍低于CARLA城镇,表明由于更真实的交通模式和严重遮挡,存在域差距。
- 所有融合方法在两个测试集上相较于非融合基线模型,IoU=0.7时的AP均至少提升10%,证明了协同感知的持续优势。
- 该基准表明,尤其是结合注意力机制的中间融合,能有效捕捉多智能体间的相关性,从而提升对被遮挡和小尺寸车辆的检测能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。