Skip to main content
QUICK REVIEW

[论文解读] Cross-Modality 3D Object Detection

Ming Zhu, Chao Ma|arXiv (Cornell University)|Aug 16, 2020
Robotics and Sensor-Based Localization参考文献 31被引用 4
一句话总结

本文提出了一种两阶段、多模态的3D目标检测框架,通过融合双目图像与原始LiDAR点云来提升检测精度。通过采用逐点特征融合、2D-3D耦合损失以及伪LiDAR点增强技术,该方法增强了稀疏点云的表征能力,并在KITTI数据集上实现了最先进性能,尤其在远距离和遮挡目标的检测上表现优异。

ABSTRACT

In this paper, we focus on exploring the fusion of images and point clouds for 3D object detection in view of the complementary nature of the two modalities, i.e., images possess more semantic information while point clouds specialize in distance sensing. To this end, we present a novel two-stage multi-modal fusion network for 3D object detection, taking both binocular images and raw point clouds as input. The whole architecture facilitates two-stage fusion. The first stage aims at producing 3D proposals through sparse point-wise feature fusion. Within the first stage, we further exploit a joint anchor mechanism that enables the network to utilize 2D-3D classification and regression simultaneously for better proposal generation. The second stage works on the 2D and 3D proposal regions and fuses their dense features. In addition, we propose to use pseudo LiDAR points from stereo matching as a data augmentation method to densify the LiDAR points, as we observe that objects missed by the detection network mostly have too few points especially for far-away objects. Our experiments on the KITTI dataset show that the proposed multi-stage fusion helps the network to learn better representations.

研究动机与目标

  • 解决3D目标检测中LiDAR点云稀疏且分布不均的问题。
  • 利用图像(丰富语义)与LiDAR(精确深度)的互补优势,提升3D定位精度。
  • 通过在多个阶段融合多模态特征,克服单模态检测的局限性。
  • 提升远距离和遮挡目标的检测性能,这些目标因点云稀疏而难以检测。
  • 提出一种基于伪LiDAR点的数据增强策略,以增强稀疏真实点云的密度。

提出的方法

  • 使用PointNet++直接从原始LiDAR点云中学习3D表征,无需体素化或投影。
  • 采用改进的ResNet-50与FPN作为图像主干网络,从双目图像中提取具有判别力的2D特征图。
  • 引入联合锚框机制,实现2D与3D分类及回归的同时优化,提升3D候选区域生成质量。
  • 应用2D-3D重投影损失,将2D检测约束与3D候选区域耦合,通过跨模态监督提升候选区域质量。
  • 在候选区域内部执行RoI级特征融合,整合密集的2D与3D特征,实现鲁棒的表征学习。
  • 通过立体匹配生成伪LiDAR点云,并将其作为数据增强手段,通过自适应裁剪与添加至真实点云中。

实验结果

研究问题

  • RQ1两阶段融合框架能否有效结合2D图像语义与3D LiDAR几何信息,以提升3D目标检测性能?
  • RQ2强制2D与3D预测保持一致性的2D-3D耦合损失,如何影响候选区域质量与最终检测精度?
  • RQ3从双目图像生成的伪LiDAR点在多大程度上可缓解远距离目标检测中的点云稀疏问题?
  • RQ4与早期或晚期融合相比,多模态特征在RoI级别上的融合是否能带来更鲁棒、更准确的3D边界框预测?
  • RQ5所提方法是否能在KITTI等标准基准上超越现有的单模态或单阶段融合方法?

主要发现

  • 所提方法在KITTI 3D目标检测基准上达到最先进性能,汽车在中等难度集上的3D AP达到86.80%。
  • 2D-3D耦合损失通过将3D候选区域与2D检测对齐,减少了IoU=0的误预测目标数量,提升了定位一致性。
  • 应用重投影损失后,所有难度等级下的候选区域召回率均显著提升,尤其在困难样本上效果明显。
  • 与伪LiDAR点的融合显著提升了困难与中等难度类别的性能,当使用GT裁剪的伪点时,困难汽车类别AP提升2.09%。
  • 由于伪LiDAR增强带来的点云密度提升,该方法在远距离和遮挡目标检测方面表现出显著优势。
  • 消融实验表明,联合锚框机制与伪LiDAR增强均对性能提升有显著贡献,其中后者在稀疏区域效果最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。