[论文解读] Radar Camera Fusion via Representation Learning in Autonomous Driving
本文提出AssociationNet,一种用于自动驾驶中雷达-相机融合的深度表示学习框架,其F1得分比基于规则的方法高出11.6%。该方法通过雷达点和2D边界框构建伪图像,并结合损失采样机制与序数损失,实现无需基于LiDAR的真值监督的鲁棒端到端数据关联。
Radars and cameras are mature, cost-effective, and robust sensors and have been widely used in the perception stack of mass-produced autonomous driving systems. Due to their complementary properties, outputs from radar detection (radar pins) and camera perception (2D bounding boxes) are usually fused to generate the best perception results. The key to successful radar-camera fusion is the accurate data association. The challenges in the radar-camera association can be attributed to the complexity of driving scenes, the noisy and sparse nature of radar measurements, and the depth ambiguity from 2D bounding boxes. Traditional rule-based association methods are susceptible to performance degradation in challenging scenarios and failure in corner cases. In this study, we propose to address radar-camera association via deep representation learning, to explore feature-level interaction and global reasoning. Additionally, we design a loss sampling mechanism and an innovative ordinal loss to overcome the difficulty of imperfect labeling and to enforce critical human-like reasoning. Despite being trained with noisy labels generated by a rule-based algorithm, our proposed method achieves a performance of 92.2% F1 score, which is 11.6% higher than the rule-based teacher. Moreover, this data-driven method also lends itself to continuous improvement via corner case mining.
研究动机与目标
- 解决自动驾驶中雷达-相机数据关联的挑战,其中传统基于规则的方法在复杂或罕见场景下表现不佳。
- 开发一种可扩展的、低成本的感知解决方案,无需依赖昂贵的基于LiDAR的真值标注。
- 通过鲁棒的深度学习训练策略,克服基于规则的关联算法产生的噪声和不完美标签的限制。
- 通过学习的表示框架实现在雷达与相机模态之间的全局推理与特征级交互。
- 设计一种支持通过角落案例挖掘持续改进的训练流程,即使在监督信号不完美时亦可实现。
提出的方法
- 通过将雷达点和2D边界框投影到相机图像平面上,并将其特征与RGB图像拼接,构建伪图像。
- 将生成的伪图像输入卷积神经网络(CNN),以学习用于物体级关联的高层语义表示。
- 使用损失采样机制,在训练过程中平衡正样本对与负样本对,以减轻噪声标签的影响。
- 引入一种新颖的序数损失,通过建模匹配对与未匹配对之间的相对置信度,实现类人推理。
- 使用基于规则算法生成的标签进行端到端训练,使模型可在无LiDAR的现实车队中部署。
- 通过最终CNN层的特征图利用全局上下文,实现超越局部距离度量的场景依赖推理。

实验结果
研究问题
- RQ1在雷达数据稀疏且噪声较大的复杂驾驶场景中,基于深度表示学习的方法是否能优于基于规则的雷达-相机关联?
- RQ2损失采样机制在减轻基于规则关联产生的不完美标签对模型训练的负面影响方面有多有效?
- RQ3序数损失在多大程度上通过将关键推理逻辑编码进学习过程,提升模型泛化能力?
- RQ4基于学习的融合框架是否能在不依赖基于LiDAR的真值标注的情况下实现高性能,从而实现大规模自动驾驶系统的可扩展性?
- RQ5与传统启发式方法相比,所提出方法在处理角落案例和罕见场景方面表现如何?
主要发现
- AssociationNet在测试集上达到92.2%的F1得分,相比基于规则的教师方法(F1为80.6%)提升了11.6%。
- 采用1:1正负样本对比例的损失采样机制相比无采样,使F1得分提升1.1%。
- 使用最优权重2.0的序数损失相比无序数监督的基线,使F1得分提升1.8%。
- 模型在挑战性场景中表现出鲁棒性,即使在密集交通和多辆大型车辆存在的情况下,仍能正确关联目标。
- 尽管在基于规则系统生成的噪声标签上进行训练,AssociationNet的泛化能力仍优于教师模型,尤其在召回率方面,从73.6%提升至93.9%。
- 可视化结果表明,模型能正确关联复杂场景中远距离或被遮挡的车辆,但小物体尺寸和遮挡问题仍导致部分错误。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。