[论文解读] Sparse Fuse Dense: Towards High Quality 3D Detection with Depth Completion
本文提出SFD,一种新颖的多模态3D目标检测框架,通过融合稀疏原始点云与通过深度补全生成的密集伪点云,提升了仅使用LiDAR的检测性能。该方法引入3D-GAF实现细粒度RoI特征融合,采用SynAugment实现同步数据增强,并设计CPConv实现高效的3D特征提取,在KITTI汽车检测基准上实现了95.52%的3D AP,达到当前最优性能。
Current LiDAR-only 3D detection methods inevitably suffer from the sparsity of point clouds. Many multi-modal methods are proposed to alleviate this issue, while different representations of images and point clouds make it difficult to fuse them, resulting in suboptimal performance. In this paper, we present a novel multi-modal framework SFD (Sparse Fuse Dense), which utilizes pseudo point clouds generated from depth completion to tackle the issues mentioned above. Different from prior works, we propose a new RoI fusion strategy 3D-GAF (3D Grid-wise Attentive Fusion) to make fuller use of information from different types of point clouds. Specifically, 3D-GAF fuses 3D RoI features from the couple of point clouds in a grid-wise attentive way, which is more fine-grained and more precise. In addition, we propose a SynAugment (Synchronized Augmentation) to enable our multi-modal framework to utilize all data augmentation approaches tailored to LiDAR-only methods. Lastly, we customize an effective and efficient feature extractor CPConv (Color Point Convolution) for pseudo point clouds. It can explore 2D image features and 3D geometric features of pseudo point clouds simultaneously. Our method holds the highest entry on the KITTI car 3D object detection leaderboard, demonstrating the effectiveness of our SFD. Codes are available at https://github.com/LittlePey/SFD.
研究动机与目标
- 解决由于远距离和遮挡区域点云稀疏导致的仅使用LiDAR的3D检测器性能受限问题。
- 克服现有多模态方法中将图像与LiDAR的2D特征拼接造成的粗粒度RoI融合策略,避免特征混淆与错位。
- 解决多模态3D检测中数据增强不足的问题,即由于视场角与遮挡限制,难以对图像增强技术进行应用。
- 设计一种高效且有效的伪点云特征提取器,能够联合捕捉2D图像特征与3D几何特征。
- 通过统一表征与支持高级增强技术,实现在KITTI 3D检测基准上的最先进性能。
提出的方法
- 通过深度补全生成密集伪点云,以丰富稀疏LiDAR点云,提升遮挡与远距离区域的几何与语义信息。
- 提出3D-GAF(3D网格注意力融合),一种基于网格化、注意力机制的细粒度RoI特征融合方法,实现对原始点云与伪点云3D RoI特征的融合。
- 引入SynAugment,一种同步数据增强策略,通过在3D空间中操作,使原本仅适用于LiDAR的增强技术(如gt-sampling、局部旋转)可有效应用于伪点云。
- 设计CPConv(颜色点卷积),一种邻域搜索方法,将每个3D RoI中的伪点投影回其原始图像空间以进行特征提取,避免视场角遮挡问题。
- 采用RoI感知的邻域搜索,确保遮挡点不干扰特征学习过程,保持特征完整性。
- 使用伪点云作为输入,端到端训练SFD框架,联合优化深度补全、检测头与特征提取模块。
实验结果
研究问题
- RQ1通过深度补全生成的密集伪点云是否能显著提升在稀疏与遮挡区域的3D检测性能?
- RQ2与传统基于拼接的融合方法相比,基于3D RoI特征而非2D裁剪特征的3D-GAF融合策略是否能带来更准确、更鲁棒的检测结果?
- RQ3能否通过在3D空间中操作伪点云,将专为仅使用LiDAR的方法设计的数据增强技术有效迁移至多模态3D检测?
- RQ4专用特征提取器如CPConv能否在不引入遮挡伪影的前提下,高效结合伪点云中的2D图像特征与3D几何特征?
- RQ5所提出的SFD框架是否在KITTI等标准3D检测基准上实现了最先进性能?
主要发现
- 在KITTI汽车检测基准的中等难度下,SFD实现了95.52%的3D AP,截至2021年11月16日,位列官方排行榜第一。
- 在中等难度下,SFD在所有三类(汽车、行人、自行车)联合训练时,相较Voxel-RCNN,汽车的3D AP提升了+6.13%,行人的3D AP提升了+2.39%,自行车的3D AP提升了+3.35%。
- 在严重遮挡(遮挡等级2)条件下,SFD在汽车检测中实现了85.57%的3D AP,相比基线模型提升了+6.84%,展现出对遮挡的强大鲁棒性。
- 在远距离(>40米)区域,SFD实现了21.91%的3D AP,相比基线提升了+6.88%,表明其在处理稀疏点云方面的有效性。
- SFD在NVIDIA RTX 2080 Ti上保持了10.2 FPS的高效推理速度,优于其他多模态方法(如PointPainting为2.5 FPS,F-PointNet为5.9 FPS)。
- 定性分析表明,SFD有效减少了因背景混淆(如将围栏误检为汽车)导致的误报,并显著提升了在遮挡与远距离场景下的定位精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。