[论文解读] OccFusion: Multi-Sensor Fusion Framework for 3D Semantic Occupancy Prediction
OccFusion 提出了一种动态多传感器融合框架,整合360°相机、激光雷达和雷达数据,用于3D语义占用预测,采用新颖的3D/2D动态融合模块以提升鲁棒性和准确性。该方法在nuScenes数据集上实现了最先进性能,尤其在夜间和雨天等挑战性条件下表现优异,全传感器融合相比仅使用相机的基线模型,mIoU最高提升6.5%。
A comprehensive understanding of 3D scenes is crucial in autonomous vehicles (AVs), and recent models for 3D semantic occupancy prediction have successfully addressed the challenge of describing real-world objects with varied shapes and classes. However, existing methods for 3D occupancy prediction heavily rely on surround-view camera images, making them susceptible to changes in lighting and weather conditions. This paper introduces OccFusion, a novel sensor fusion framework for predicting 3D occupancy. By integrating features from additional sensors, such as lidar and surround view radars, our framework enhances the accuracy and robustness of occupancy prediction, resulting in top-tier performance on the nuScenes benchmark. Furthermore, extensive experiments conducted on the nuScenes and semanticKITTI dataset, including challenging night and rainy scenarios, confirm the superior performance of our sensor fusion strategy across various perception ranges. The code for this framework will be made available at https://github.com/DanielMing123/OccFusion.
研究动机与目标
- 解决在光照和天气条件恶劣时仅使用相机进行3D占用预测的局限性。
- 整合激光雷达(几何精度高)和雷达(抗恶劣天气能力强)与相机(语义信息丰富)的互补优势,以提升场景理解能力。
- 开发一种统一且高效的融合框架,增强模型在不同感知范围和环境条件下的鲁棒性。
- 利用nuScenes基准评估多传感器融合策略在夜间和雨天等挑战性场景下的性能增益。
提出的方法
- 提出一种动态融合3D/2D模块,利用可学习的注意力机制将相机的BEV特征与激光雷达和雷达的3D特征体积进行融合。
- 采用多尺度粗到细的细化结构,并引入多级监督,以提升所有空间层级的特征表示能力。
- 引入BEV特征作为全局激励信号,引导3D特征融合并加速收敛过程。
- 在2D和3D空间中均使用SENet模块,动态重校准多模态特征,增强关键特征的放大效果。
- 支持三种融合策略:Camera+Radar、Camera+Lidar 和 Camera+Lidar+Radar,支持消融实验与对比分析。
- 在提升到3D之前,于鸟瞰图(BEV)空间中进行特征级融合,实现有效的跨模态交互。

实验结果
研究问题
- RQ1将激光雷达和雷达与相机数据融合,如何改善在光照和天气条件恶劣情况下的3D语义占用预测?
- RQ2在不同感知范围内,各传感器模态(相机、激光雷达、雷达)对最终预测性能的相对贡献如何?
- RQ3所提出的动态融合3D/2D模块与简单的拼接或固定注意力机制相比,在多模态特征融合中的表现如何?
- RQ4多尺度监督与细化结构对模型收敛速度和性能的影响是什么?
- RQ5在极端场景(如夜间和雨天)下,全传感器融合策略(相机+激光雷达+雷达)相较于单模态或双模态基线模型的表现如何?
主要发现
- 完整版OccFusion框架(Camera+Lidar+Radar)在nuScenes验证集上达到30.97%的平均交并比(mIoU),优于仅使用相机的基线模型。
- 在夜间和雨天场景中,增加激光雷达和雷达使mIoU相比仅使用相机的模型最高提升6.5个百分点。
- 采用多尺度粗到细细化结构并结合多级监督,相比单尺度基线,mIoU提升5.23个百分点。
- 若在动态融合模块中移除BEV特征,mIoU下降6.5%,证明其在引导3D特征融合中的关键作用。
- SENet3D和SENet2D模块显著提升性能,当两者均被禁用时,mIoU下降超过6%。
- 该框架在不同感知范围内均保持优异性能,Camera+Lidar+Radar融合策略在所有距离范围内均表现出一致的性能增益。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。