[论文解读] Deep Positional and Relational Feature Learning for Rotation-Invariant Point Cloud Analysis
该论文提出PR-invNet,一种用于3D点云分析的旋转不变深度网络,通过两种新颖模块——位置特征嵌入(PFE)模块和关系特征嵌入(RFE)模块——联合学习位置特征与关系特征。PFE模块利用十二面体的交错群$A_5$构建旋转不变的姿态空间,并通过多头得分网络选择最具判别性的形状姿态;RFE模块则通过关系感知卷积增强特征。该方法在ModelNet40和ShapeNetPart数据集上达到最先进性能,ModelNet40准确率达89.2%,PartNet准确率达89.5%,展现出对旋转和噪声的强鲁棒性。
In this paper we propose a rotation-invariant deep network for point clouds analysis. Point-based deep networks are commonly designed to recognize roughly aligned 3D shapes based on point coordinates, but suffer from performance drops with shape rotations. Some geometric features, e.g., distances and angles of points as inputs of network, are rotation-invariant but lose positional information of points. In this work, we propose a novel deep network for point clouds by incorporating positional information of points as inputs while yielding rotation-invariance. The network is hierarchical and relies on two modules: a positional feature embedding block and a relational feature embedding block. Both modules and the whole network are proven to be rotation-invariant when processing point clouds as input. Experiments show state-of-the-art classification and segmentation performances on benchmark datasets, and ablation studies demonstrate effectiveness of the network design.
研究动机与目标
- 解决现有基于点的深度网络依赖原始坐标而对任意3D旋转敏感的问题。
- 在实现严格旋转不变性的同时,保留具有判别性的位置信息,用于点云深度特征学习。
- 设计一种分层网络架构,整合位置与关系特征,以提升3D形状识别性能。
- 克服仅依赖几何特征方法的局限性,后者会丢失空间上下文信息,难以区分相似的局部结构。
- 开发一种可扩展且高效的旋转不变网络,避免昂贵的数据增强,且在噪声和未见旋转下具有良好泛化能力。
提出的方法
- PFE模块利用十二面体的交错群$A_5$构建旋转不变的姿态空间,将输入点云映射到120种旋转姿态。
- 多头得分网络($\Psi$)作为姿态选择器,基于多头输出的最大得分,从旋转空间中选择最具代表性的姿态。
- 使用选定姿态的坐标,通过位置特征提取器提取位置特征,确保局部几何结构的判别性表征。
- RFE模块采用关系感知卷积,包含三个组件:相对点位置、几何特征(如距离、角度)以及点特征,均具有可学习权重。
- 所有网络组件,包括PFE和RFE模块,在SO(3)群下均经过数学证明具有旋转不变性。
- 完整网络PR-invNet通过标准基准数据集,端到端训练用于分类与分割任务。
实验结果
研究问题
- RQ1深度网络能否在不依赖数据增强的前提下,从原始点坐标中学习旋转不变特征?
- RQ2在点云分析中,如何在实现对任意3D旋转不变性的同时保留位置信息?
- RQ3在旋转不变特征学习框架中,使用多头得分网络进行姿态选择有何影响?
- RQ4基于点位置与几何关系的关系特征,相比仅使用几何特征,性能提升如何?
- RQ5所提架构在噪声和任意旋转下,其鲁棒性在多大程度上得以保持?
主要发现
- PR-invNet在ModelNet40上实现89.2%的分类准确率,在z/SO(3)旋转模式下优于先前最先进方法。
- 消融实验表明,采用姿态选择的完整PFE模块优于通过最大值或平均池化进行特征聚合,实现88.5%准确率,且GPU显存减少58%,训练时间减少49%。
- 使用200个头的多头得分网络($\Psi$)优于单头或其他头数配置,表明其具备更优的姿态选择能力。
- RFE模块包含全部三个组件(位置、几何、特征)时性能最佳,移除任一组件均导致准确率下降。
- 网络在噪声环境下保持鲁棒性,加入标准差为0.01的高斯噪声后仍达88.6%准确率,表明对扰动输入具有强泛化能力。
- 可视化显示,多头得分网络中每个头均选择具有相似朝向的姿态,表明网络学习到将形状聚类为有意义姿态组的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。