Skip to main content
QUICK REVIEW

[论文解读] DRINet: A Dual-Representation Iterative Learning Network for Point Cloud Segmentation

Maosheng Ye, Shuangjie Xu|arXiv (Cornell University)|Aug 9, 2021
3D Shape Modeling and Analysis参考文献 42被引用 6
一句话总结

DRINet 提出了一种用于点云分割的双表示迭代学习网络,通过新颖的稀疏点-体素和稀疏体素-点特征提取模块,在稀疏点和体素表示之间交替优化特征。通过引入多尺度池化层和注意力聚合机制,该方法在多个基准测试中实现了最先进性能,同时保持了实时推理速度(每帧62ms)。

ABSTRACT

We present a novel and flexible architecture for point cloud segmentation with dual-representation iterative learning. In point cloud processing, different representations have their own pros and cons. Thus, finding suitable ways to represent point cloud data structure while keeping its own internal physical property such as permutation and scale-invariant is a fundamental problem. Therefore, we propose our work, DRINet, which serves as the basic network structure for dual-representation learning with great flexibility at feature transferring and less computation cost, especially for large-scale point clouds. DRINet mainly consists of two modules called Sparse Point-Voxel Feature Extraction and Sparse Voxel-Point Feature Extraction. By utilizing these two modules iteratively, features can be propagated between two different representations. We further propose a novel multi-scale pooling layer for pointwise locality learning to improve context information propagation. Our network achieves state-of-the-art results for point cloud classification and segmentation tasks on several datasets while maintaining high runtime efficiency. For large-scale outdoor scenarios, our method outperforms state-of-the-art methods with a real-time inference speed of 62ms per frame.

研究动机与目标

  • 解决大规模室外场景中点云分割的效率与性能平衡挑战。
  • 克服现有双表示网络中简单特征融合与双线性聚合方法导致的性能下降与计算成本增加问题。
  • 在保持排列与尺度不变性的同时,实现点表示与体素表示之间灵活、迭代的特征传播。
  • 通过体素层级的多尺度特征聚合,提升上下文信息学习能力。
  • 通过注意力聚合机制,降低从体素到点表示的特征转换计算开销。

提出的方法

  • 引入两个核心模块:稀疏点-体素特征提取(SPVFE)与稀疏体素-点特征提取(SVPFE),实现点与体素表示之间的迭代特征优化。
  • 在体素层级引入一种新颖的多尺度池化层,聚合多个感受野的特征,增强局部上下文学习能力。
  • 用注意力聚合层替代双线性/三线性插值,通过预计算的注意力权重降低特征退化与计算成本。
  • 采用双表示策略,结合点特征的细粒度细节与体素特征的结构化、大感受野优势。
  • 在SPVFE与SVPFE模块之间应用迭代特征传播,实现跨表示的特征相互增强。
  • 在ModelNet40与ShapeNet数据集上训练时,采用标准数据增强(旋转、缩放、翻转、扰动)与归一化处理。

实验结果

研究问题

  • RQ1在点与体素表示之间进行迭代特征学习,是否能在保持实时推理的同时提升分割精度?
  • RQ2在体素层级的多尺度池化如何影响点云分割中的上下文信息传播?
  • RQ3注意力聚合机制是否能在从体素到点的特征转换中超越传统的双线性/三线性插值?
  • RQ4与单表示或简单融合方法相比,采用迭代优化的双表示学习在多大程度上更具优势?
  • RQ5在SemanticKITTI等大规模室外数据集上,DRINet在精度与速度方面相较于最先进方法表现如何?

主要发现

  • DRINet在SemanticKITTI数据集上实现了67.3%的平均交并比(mIoU),优于先前最先进方法,且每帧推理时间仅为62ms。
  • 多尺度池化层使SemanticKITTI上的mIoU提升了1.9个百分点(从65.4%提升至67.3%),证明其在上下文学习中的有效性。
  • 注意力聚合机制相比最近邻插值提升了0.8%的性能,且在特征退化方面优于双线性插值。
  • 在ModelNet40上,DRINet达到93.0%的准确率,超越先前最先进单表示方法,并优于双表示PVCNN。
  • 在ShapeNet Parts上,DRINet仅用30ms延迟即实现86.4%的mIoU,优于KPConv与PVCNN,且计算量更低。
  • 在S3DIS Area 5上,DRINet实现66.7%的mIoU,与最佳单表示方法(CloserLook3D)持平,且优于双表示PVCNN,同时计算成本更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。