[论文解读] Spherical Kernel for Efficient Graph Convolution on 3D Point Clouds
本文提出一种球形核,用于在3D点云上实现高效的图卷积,通过将局部3D空间划分为离散的体积累积箱,实现平移不变性、非对称性及计算高效性。该方法在点云分类与语义分割任务上达到当前最优性能,相比先前方法显著减少了参数量与推理时间。
We propose a spherical kernel for efficient graph convolution of 3D point clouds. Our metric-based kernels systematically quantize the local 3D space to identify distinctive geometric relationships in the data. Similar to the regular grid CNN kernels, the spherical kernel maintains translation-invariance and asymmetry properties, where the former guarantees weight sharing among similar local structures in the data and the latter facilitates fine geometric learning. The proposed kernel is applied to graph neural networks without edge-dependent filter generation, making it computationally attractive for large point clouds. In our graph networks, each vertex is associated with a single point location and edges connect the neighborhood points within a defined range. The graph gets coarsened in the network with farthest point sampling. Analogous to the standard CNNs, we define pooling and unpooling operations for our network. We demonstrate the effectiveness of the proposed spherical kernel with graph neural networks for point cloud classification and semantic segmentation using ModelNet, ShapeNet, RueMonge2014, ScanNet and S3DIS datasets. The source code and the trained models can be downloaded from https://github.com/hlei-ziyan/SPH3D-GCN.
研究动机与目标
- 解决在不规则3D点云数据上应用高效、离散卷积操作的挑战。
- 设计一种保持平移不变性与非对称性的核,以实现有效的几何特征学习,且无需依赖边的滤波器生成。
- 通过利用最远点采样与池化/反池化操作构建图金字塔,实现大规模点云的高效处理。
- 相比PointCNN与PointNet++等现有方法,降低计算开销与模型复杂度。
- 通过轻量级、可学习的球形核,在合成与真实世界3D点云基准上展示具有竞争力的性能。
提出的方法
- 球形核将每个点周围的局部3D空间划分为离散的体积累积箱,为每个箱子分配可学习权重,形成离散卷积操作。
- 该核在空间图神经网络中应用,其中顶点代表点,边通过在指定半径内的范围搜索生成。
- 通过最远点采样(FPS)执行图下采样,构建图的分层金字塔,类似于标准CNN中的特征图下采样。
- 定义了池化与反池化操作,用于在图层级之间下采样与上采样顶点特征,支持U-Net类架构用于分割任务。
- 通过在相似局部几何结构间共享权重,保持平移不变性;通过独立处理顶点对,保持非对称性,以保留特征紧凑性。
- 网络通过标准反向传播端到端训练,联合学习核权重与特征表示。
实验结果
研究问题
- RQ1能否设计一种离散的、可学习的球形核,以实现在3D点云上的高效且有效的图卷积?
- RQ2所提出的核是否能在避免依赖边的滤波器生成的前提下,保持平移不变性与非对称性?
- RQ3基于球形卷积的图金字塔架构能否在点云分类与语义分割任务上实现具有竞争力的性能?
- RQ4与PointNet++和PointCNN等现有最先进方法相比,该方法在效率与准确率方面表现如何?
- RQ5球形核在不同局部几何上下文中,能多大程度上学习到多样化、任务特定的特征?
主要发现
- 所提出的SPH3D-GCN在ModelNet40、ShapeNet与S3DIS数据集上的点云分类与语义分割任务中达到当前最优性能。
- 网络能高效处理最多65,536个点的点云,32,768个点时内存占用为8.45GB,略低于PointNet++在1,024个点时的8.57GB。
- 模型仅含0.4百万参数,相比PointCNN的440万参数减少逾10倍,即使使用更大的批量大小。
- 在2,048、4,096与8,192个点的输入下,单样本推理时间与PointCNN相当或更优,且计算开销显著降低。
- 核可视化显示,不同学习到的核在检测不同几何模式方面具有专长,例如上半球为正权重、下半球为负权重,表明特征多样性。
- 通过最远点采样实现的图下采样能逐层有效降低分辨率,同时保留结构信息,支持分层特征学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。