Skip to main content
QUICK REVIEW

[论文解读] ASAP-Net: Attention and Structure Aware Point Cloud Sequence Segmentation

Hanwen Cao, Yongyi Lu|arXiv (Cornell University)|Aug 12, 2020
3D Shape Modeling and Analysis参考文献 40被引用 8
一句话总结

ASAP-Net 提出了一种新颖的注意力与结构感知模块(ASAP),用于点云序列分割,通过注意力时间嵌入层融合跨帧的局部特征,并利用时空相关性策略强化时间一致性,从而提升时空特征学习能力。该方法在集成多种主干网络时,在 Synthia 和 SemanticKITTI 数据集上实现了最先进性能,mIoU 提升达 3.4 至 15.2 个百分点。

ABSTRACT

Recent works of point clouds show that mulit-frame spatio-temporal modeling outperforms single-frame versions by utilizing cross-frame information. In this paper, we further improve spatio-temporal point cloud feature learning with a flexible module called ASAP considering both attention and structure information across frames, which we find as two important factors for successful segmentation in dynamic point clouds. Firstly, our ASAP module contains a novel attentive temporal embedding layer to fuse the relatively informative local features across frames in a recurrent fashion. Secondly, an efficient spatio-temporal correlation method is proposed to exploit more local structure for embedding, meanwhile enforcing temporal consistency and reducing computation complexity. Finally, we show the generalization ability of the proposed ASAP module with different backbone networks for point cloud sequence segmentation. Our ASAP-Net (backbone plus ASAP module) outperforms baselines and previous methods on both Synthia and SemanticKITTI datasets (+3.4 to +15.2 mIoU points with different backbones). Code is availabe at https://github.com/intrepidChw/ASAP-Net

研究动机与目标

  • 通过有效建模动态场景中的时空依赖关系,提升点云序列分割性能。
  • 解决在不同可靠性与噪声水平下跨多帧特征融合的挑战。
  • 即使在点分布无序且动态变化的情况下,也能实现鲁棒的点对点关联。
  • 设计一种灵活的模块,可轻松集成到现有的静态点云分割流水线中。
  • 在多种主干网络和数据集上展示方法的泛化能力。

提出的方法

  • 引入一种注意力时间嵌入层,通过可学习的注意力权重自适应地融合多帧的局部特征,优先选择信息量大的帧。
  • 提出一种时空相关性策略,利用动态的、基于注意力的分组机制,在时空维度上对点进行分组,以保持结构一致性。
  • 采用多尺度局部特征聚合(LSA)模块,提取鲁棒的中心点特征,增强细粒度表征能力。
  • 将 ASAP 模块设计为即插即用组件,兼容多种静态点云主干网络,如 PointNet++ 和 SqueezeSegV2。
  • 采用循环特征融合机制,在降低计算复杂度的同时保持时间连贯性。
  • 在与基于图像的主干网络集成时,使用最大池化操作实现从 2D 到 3D 点云的重建,以最小化信息损失。

实验结果

研究问题

  • RQ1注意力机制能否有效优先选择信息量大的帧,用于动态点云序列中的特征融合?
  • RQ2如何建模时空相关性,以保持局部结构并强制实现时间一致性?
  • RQ3基于模块化、注意力机制的时间融合组件在多种主干网络上能将分割性能提升多少?
  • RQ4所提出的方法在点云序列分割任务中是否具有跨不同数据集和主干架构的泛化能力?
  • RQ5输入序列长度和分组半径对模型性能与鲁棒性有何影响?

主要发现

  • 在 Synthia 和 SemanticKITTI 数据集上,ASAP-Net 相较基线模型,mIoU 提升幅度为 3.4 至 15.2 个百分点,具体取决于所使用的主干网络。
  • 时空相关性策略(STC ii)优于 STC (i),当使用 3 帧序列时,mIoU 从 81.78 提升至 82.73,证明了所提相关性设计的有效性。
  • 随着输入序列变长,性能持续提升,mIoU 从 3 帧时的 82.73 提升至 6 帧时的 83.00,表明模型有效利用了时间上下文信息。
  • 该方法显著提升了 PointNet++ 的性能(mIoU 从 79.35 提升至 83.00),而 SqueezeSegV2 的增益较小,原因在于架构不兼容及 2D 重建过程中的信息损失。
  • 通过在 LSA 模块中引入多尺度分组,SqueezeSegV2 中卡车和电线杆类别的失败案例得到缓解,相关类别的 mIoU 显著提升。
  • 消融实验证实,注意力时间嵌入和时空相关性组件均对性能提升至关重要,且 STC (ii) 在时间一致性方面优于 STC (i)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。