Skip to main content
QUICK REVIEW

[论文解读] DRINet++: Efficient Voxel-as-point Point Cloud Segmentation

Maosheng Ye, Rui Wan|arXiv (Cornell University)|Nov 16, 2021
3D Shape Modeling and Analysis参考文献 59被引用 16
一句话总结

DRINet++ 提出了一种高效的点云语义分割网络,通过将体素视为点,在单一稀疏体素表示中利用稀疏性和几何信息。通过引入稀疏特征编码器和多尺度投影与注意力融合的稀疏几何特征增强模块,其在 SemanticKITTI 和 nuScenes 数据集上实现了最先进性能,推理时间仅 59ms,内存使用量比之前方法降低 30%。

ABSTRACT

Recently, many approaches have been proposed through single or multiple representations to improve the performance of point cloud semantic segmentation. However, these works do not maintain a good balance among performance, efficiency, and memory consumption. To address these issues, we propose DRINet++ that extends DRINet by enhancing the sparsity and geometric properties of a point cloud with a voxel-as-point principle. To improve efficiency and performance, DRINet++ mainly consists of two modules: Sparse Feature Encoder and Sparse Geometry Feature Enhancement. The Sparse Feature Encoder extracts the local context information for each point, and the Sparse Geometry Feature Enhancement enhances the geometric properties of a sparse point cloud via multi-scale sparse projection and attentive multi-scale fusion. In addition, we propose deep sparse supervision in the training phase to help convergence and alleviate the memory consumption problem. Our DRINet++ achieves state-of-the-art outdoor point cloud segmentation on both SemanticKITTI and Nuscenes datasets while running significantly faster and consuming less memory.

研究动机与目标

  • 解决自动驾驶中点云分割在性能、效率与内存消耗之间的权衡问题。
  • 探索是否仅通过单一稀疏体素表示(视为'点')即可完全利用稀疏性与几何信息,而无需多表示融合。
  • 在保持或提升分割准确率的同时,降低内存使用量与训练成本。
  • 开发一种轻量化、高效且可扩展至大规模室外点云的架构。

提出的方法

  • DRINet++ 将体素视为点,以在稀疏体素表示上执行点操作,从而减少内存与计算开销。
  • 引入稀疏特征编码器(SFE)从体素点中提取局部上下文特征。
  • 稀疏几何特征增强(SGFE)模块通过多尺度稀疏投影实现分层几何特征学习。
  • 注意力多尺度融合(AMF)层选择性地融合多尺度特征,以增强几何表征。
  • 训练过程中应用深度稀疏监督,以减少内存消耗并加速收敛。
  • 在 SFE 与 SGFE 模块之间进行迭代特征优化,以最小开销提升特征学习能力。

实验结果

研究问题

  • RQ1在单一稀疏表示中将体素视为点,是否能比多表示方法实现更优的性能与效率?
  • RQ2体素作为点(VAP)的设计在大规模点云分割中对内存消耗与推理速度有何影响?
  • RQ3多尺度稀疏投影与注意力融合在稀疏点云中能多大程度上提升几何特征学习?
  • RQ4深度稀疏监督是否能显著降低内存使用量,而不会损害模型收敛性或准确率?

主要发现

  • DRINet++ 在 SemanticKITTI 验证集上实现了 71.0% 的最先进 mIoU,优于 DRINet、SPVCNN 及其他 SOTA 方法。
  • 该模型在 NVIDIA RTX 2080Ti 上每帧推理仅需 59ms,展现出极高的推理效率。
  • 体素作为点(VAP)设计使内存使用量相比非 VAP 基线降低约 30%,mIoU 仅下降 0.2%。
  • 深度稀疏监督将内存占用降至 1.4GB(对比密集监督的 552MB),支持更大批量与更快训练。
  • 消融实验表明,注意力多尺度融合(AMF)层相比张量求和提升 mIoU 2.0%,相比拼接提升 1.2%。
  • 当应用于 SPVCNN 和 DRINet 等其他模型时,深度稀疏监督在无额外推理成本下将 mIoU 提升最高达 2.0%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。