[论文解读] M3DeTR: Multi-representation, Multi-scale, Mutual-relation 3D Object Detection with Transformers
M3DETR 提出了一种基于 Transformer 的新型 3D 目标检测框架,通过专用的 M3 Transformer 统一了多表示(原始点云、体素、鸟瞰图)、多尺度特征金字塔以及点云特征之间的相互关系。该方法在 KITTI 和 Waymo Open Dataset 上实现了最先进性能,所有类别 mAP 提升 1.48%,并在单帧输入下在两个基准测试中均排名第一。
We present a novel architecture for 3D object detection, M3DeTR, which combines different point cloud representations (raw, voxels, bird-eye view) with different feature scales based on multi-scale feature pyramids. M3DeTR is the first approach that unifies multiple point cloud representations, feature scales, as well as models mutual relationships between point clouds simultaneously using transformers. We perform extensive ablation experiments that highlight the benefits of fusing representation and scale, and modeling the relationships. Our method achieves state-of-the-art performance on the KITTI 3D object detection dataset and Waymo Open Dataset. Results show that M3DeTR improves the baseline significantly by 1.48% mAP for all classes on Waymo Open Dataset. In particular, our approach ranks 1st on the well-known KITTI 3D Detection Benchmark for both car and cyclist classes, and ranks 1st on Waymo Open Dataset with single frame point cloud input. Our code is available at: https://github.com/rayguan97/M3DETR.
研究动机与目标
- 为解决现有 3D 目标检测器在有效融合多种点云表示(原始点云、体素、鸟瞰图)和多尺度特征方面的局限性。
- 克服因不同表示类型之间架构和输入格式差异导致的语义鸿沟。
- 同时建模点云中点之间的相互关系,以提升对细粒度和复杂场景模式的检测能力。
- 设计一种统一的、端到端可训练的架构,利用 Transformer 整合表示、尺度和关系建模,且对超参数不敏感。
- 在 KITTI 和 Waymo Open Dataset 等标准基准上实现最先进检测精度。
提出的方法
- M3DETR 采用三种专用的 M3 Transformer:多表示、多尺度和相互关系 Transformer,每种分别用于处理点云数据的特定方面。
- 多表示 Transformer 使用多头自注意力机制,融合来自原始点云、体素网格和鸟瞰图的特征,以减少语义鸿沟。
- 多尺度 Transformer 通过特征金字塔聚合不同分辨率层级的特征,注意力机制增强了跨尺度的相关性。
- 相互关系 Transformer 使用多头自注意力机制建模点之间的长程依赖关系和相互关系,提升特征判别能力。
- 所有组件集成于两阶段检测流程中:区域建议网络(RPN)后接基于 Transformer 的头部用于边界框预测。
- 整个架构通过交叉注意力机制实现端到端训练,实现表示、尺度和关系特征的联合优化。
实验结果
研究问题
- RQ1统一的基于 Transformer 的架构能否有效融合多种点云表示(原始点云、体素、BEV),同时保持特征一致性?
- RQ2与拼接或上采样相比,通过注意力机制建模多尺度特征是否能提升 3D 目标检测性能?
- RQ3建模点之间的相互关系能否提升检测精度,特别是对小物体或被遮挡物体?
- RQ4所提出的 M3DETR 架构对 Transformer 深度、头数和采样策略等超参数变化是否具有鲁棒性?
- RQ5联合建模表示、尺度和关系是否能在 KITTI 和 Waymo Open Dataset 上实现最先进性能?
主要发现
- M3DETR 在 KITTI 3D 检测基准上实现最先进性能,汽车和骑行人分类均排名第一。
- 在 Waymo Open Dataset 上,M3DETR 相较于之前的 SOTA,所有类别 mAP 提升 1.48%,汽车类别 mAP 提升 2.86%。
- 消融实验表明,结合多表示、多尺度和相互关系模块在汽车类别中中等难度下带来 4.07% 的 mAP 提升。
- 仅相互关系 Transformer 模块即可在中等难度下提升 mAP 4.47%,证明其显著贡献。
- M3DETR 对超参数变化具有高度鲁棒性,在不同深度的 Transformer 层、头数和建议框采样大小下均保持强性能。
- 可视化结果表明,与 PV-RCNN 相比,M3DETR 显著减少了误检数量,尤其在存在遮挡的复杂场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。