[论文解读] mmFUSION: Multimodal Fusion for 3D Objects Detection
该论文提出 mmFUSION,一种用于 3D 目标检测的新型中间层多模态融合框架,通过在将图像和 LiDAR 特征转换为共享的低分辨率 3D 体积后,利用跨模态和多模态注意力机制进行融合。该方法在 KITTI 和 NuScenes 数据集上优于早期、晚期和两阶段融合基线模型,实现了最先进性能,且无需依赖区域提议或早期特征对齐。
Multi-sensor fusion is essential for accurate 3D object detection in self-driving systems. Camera and LiDAR are the most commonly used sensors, and usually, their fusion happens at the early or late stages of 3D detectors with the help of regions of interest (RoIs). On the other hand, fusion at the intermediate level is more adaptive because it does not need RoIs from modalities but is complex as the features of both modalities are presented from different points of view. In this paper, we propose a new intermediate-level multi-modal fusion (mmFUSION) approach to overcome these challenges. First, the mmFUSION uses separate encoders for each modality to compute features at a desired lower space volume. Second, these features are fused through cross-modality and multi-modality attention mechanisms proposed in mmFUSION. The mmFUSION framework preserves multi-modal information and learns to complement modalities' deficiencies through attention weights. The strong multi-modal features from the mmFUSION framework are fed to a simple 3D detection head for 3D predictions. We evaluate mmFUSION on the KITTI and NuScenes dataset where it performs better than available early, intermediate, late, and even two-stage based fusion schemes. The code with the mmdetection3D project plugin will be publicly available soon.
研究动机与目标
- 为解决早期和晚期融合在 3D 目标检测中的局限性,提出一种更具自适应性的中间层融合策略。
- 通过将不同模态转换到共同的 3D 特征空间,克服多模态融合中的特征错位和信息损失问题。
- 实现在无需依赖感兴趣区域(RoI)提议或预训练单模态检测器的前提下,联合学习相机和 LiDAR 的互补特征。
- 设计一种基于注意力的融合机制,动态加权并增强来自两种模态的特征,以提升检测精度。
- 为未来多模态 3D 检测研究建立一个强大、单阶段、特征级融合的基线。
提出的方法
- 该框架使用独立的图像和 LiDAR 编码器,将高维特征投影到低分辨率 3D 体积中,以保留空间和语义信息。
- 应用跨模态注意力机制,通过 3D 卷积层和 Sigmoid 门控,对齐并加权图像和 LiDAR 模态的特征。
- 多模态注意力进一步通过残差块和注意力加权,学习模态特定的重要性,以优化融合特征。
- 将融合后的特征解码为适合标准 3D 检测头的最终联合表示。
- 整个网络通过 3D 检测头进行端到端训练,实现边界框回归和分类。
- 该方法避免依赖 RoI 或提议,从而实现更灵活、更具自适应性的融合流程。

实验结果
研究问题
- RQ1在不依赖区域提议的情况下,中间层融合能否在 3D 目标检测中优于早期和晚期融合?
- RQ2跨模态和多模态注意力机制如何在共享 3D 空间中有效对齐并增强相机和 LiDAR 的特征?
- RQ3在多模态 3D 检测中,如何在性能与计算成本之间取得平衡,以确定最优的特征体素大小和网络配置?
- RQ4一个单阶段、可端到端训练的融合框架能否在 KITTI 和 NuScenes 等标准基准上实现最先进性能?
- RQ5所提出的融合机制如何处理 LiDAR 点云稀疏或相机特征微弱的物体?
主要发现
- mmFUSION 在 KITTI 数据集上实现了最先进性能,优于现有的早期、中间、晚期和两阶段融合方法。
- 在 NuScenes 数据集上,mmFUSION 的 mAP 比次优基线高出 3.5%,展现出卓越的泛化能力。
- mmFUSION 的基础配置(176×200×5 特征体素)在性能与计算成本之间实现了最佳权衡。
- 消融研究证实,增大特征体素尺寸可提升 mAP,但超过某一临界点后收益递减。
- 定性可视化显示,mmFUSION 即使在无 LiDAR 点的区域,也能通过利用相机语义有效定位物体。
- 该框架成功检测到未出现在真实标注中的物体,表明其对传感器噪声和遮挡具有鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。