[论文解读] CoBEVFusion: Cooperative Perception with LiDAR-Camera Bird's-Eye View Fusion
本文提出 CoBEVFusion,一种协作感知框架,通过双窗口交叉注意力(DWCA)模块将激光雷达与相机数据融合为统一的鸟瞰图(BEV)表征。该方法通过让联网自动驾驶汽车(CAVs)共享融合后的 BEV 特征,提升了 3D 目标检测与 BEV 语义分割性能,在 OPV2V 基准上实现最先进性能,车辆检测的 AP@.7 达 92.5%,领域自适应任务中达到 86.5%。
Autonomous Vehicles (AVs) use multiple sensors to gather information about their surroundings. By sharing sensor data between Connected Autonomous Vehicles (CAVs), the safety and reliability of these vehicles can be improved through a concept known as cooperative perception. However, recent approaches in cooperative perception only share single sensor information such as cameras or LiDAR. In this research, we explore the fusion of multiple sensor data sources and present a framework, called CoBEVFusion, that fuses LiDAR and camera data to create a Bird's-Eye View (BEV) representation. The CAVs process the multi-modal data locally and utilize a Dual Window-based Cross-Attention (DWCA) module to fuse the LiDAR and camera features into a unified BEV representation. The fused BEV feature maps are shared among the CAVs, and a 3D Convolutional Neural Network is applied to aggregate the features from the CAVs. Our CoBEVFusion framework was evaluated on the cooperative perception dataset OPV2V for two perception tasks: BEV semantic segmentation and 3D object detection. The results show that our DWCA LiDAR-camera fusion model outperforms perception models with single-modal data and state-of-the-art BEV fusion models. Our overall cooperative perception architecture, CoBEVFusion, also achieves comparable performance with other cooperative perception models.
研究动机与目标
- 通过多模态传感器融合,解决单传感器感知在自动驾驶中因遮挡和视场受限带来的局限性。
- 通过共享融合后的激光雷达-相机 BEV 表征而非原始数据或预测结果,提升联网自动驾驶汽车(CAVs)中的协作感知性能。
- 开发一种有效的交叉注意力机制,实现在统一 BEV 空间中对稀疏激光雷达点云与密集相机特征的对齐与融合。
- 在协作感知条件下,实现对多个任务(BEV 语义分割与 3D 目标检测)的鲁棒、高精度感知。
- 在大规模仿真基准(OPV2V)上评估所提框架,并证明其在性能上优于单模态与最先进多模态融合模型。
提出的方法
- 该框架采用基于双窗口的交叉注意力(DWCA)模块,通过两个输入顺序相反的交叉注意力块实现:一个以激光雷达特征为查询、相机特征为键,另一个则相反。
- 首先将激光雷达点云与多视角相机图像编码并投影到共享的鸟瞰图(BEV)特征空间中,以实现几何与语义对齐。
- DWCA 模块通过允许两种模态相互关注对方的表征,实现双向特征增强,从而提升特征质量与上下文理解能力。
- 通过三维卷积神经网络(3D-CNN)聚合来自多个 CAV 的融合 BEV 表征,以增强感知的鲁棒性与覆盖范围。
- 系统采用中间融合策略,仅通过 V2X 通信在 CAV 间共享融合后的 BEV 特征,在带宽效率与上下文信息保留之间取得平衡。
- 整个流程端到端可训练,并针对两项感知任务进行优化:BEV 语义分割与 3D 目标检测。
实验结果
研究问题
- RQ1双注意力机制是否能有效融合稀疏激光雷达点云与密集相机图像,实现在统一 BEV 表征中的感知性能提升?
- RQ2与单辆车辆感知及其他融合策略相比,使用共享融合 BEV 特征的协作感知在检测准确率与鲁棒性方面表现如何?
- RQ3DWCA 模块在多模态 BEV 感知中是否显著优于现有基于注意力的融合方法?
- RQ4在 BEV 空间中协作融合激光雷达与相机数据,是否能显著提升对远距离或被遮挡车辆的检测能力?
- RQ5该框架在真实世界泛化基准(如新环境下的领域自适应)中的表现如何?
主要发现
- DWCA 模块在 3D 目标检测任务中实现了 64.7% 的 AP@.7(车辆检测),显著优于单模态 PointPillars 基线模型(60.2%)。
- CoBEVFusion 在 OPV2V 默认 CARLA 城市测试集上实现了 92.5% 的 AP@.7(车辆检测),超越所有对比模型,包括 SOTA 方法如 S-AdaFusion(91.6%)。
- 在 Culver City 领域自适应基准上,CoBEVFusion 达到 86.5% 的 AP@.7,优于次佳模型 C-AdaFusion(81.4%)。
- 消融研究证实,结合 WCA(LC)与 WCA(CL)块的 DWCA 实现了最高的 mIoU(61.4,可行驶区域)与 47.6(车道分割),优于单模态基线模型。
- 定性结果表明,协作感知显著提升了对远距离及被遮挡车辆的检测能力,尤其在路口前表现突出。
- 该框架表明,融合 BEV 表征的中间融合策略在带宽效率与上下文信息保留之间提供了更优的权衡,优于早期或晚期融合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。