[论文解读] Learning to Segment 3D Point Clouds in 2D Image Space
本文提出了一种新颖的方法,通过使用拓扑保持的图到网格映射(基于整数规划和图绘制)将3D点云投影到2D图像空间,从而能够使用标准的2D卷积神经网络(如U-Net)进行分割。该方法在ShapeNet和PartNet数据集上实现了最先进性能,相较于先前方法有显著提升。
In contrast to the literature where local patterns in 3D point clouds are captured by customized convolutional operators, in this paper we study the problem of how to effectively and efficiently project such point clouds into a 2D image space so that traditional 2D convolutional neural networks (CNNs) such as U-Net can be applied for segmentation. To this end, we are motivated by graph drawing and reformulate it as an integer programming problem to learn the topology-preserving graph-to-grid mapping for each individual point cloud. To accelerate the computation in practice, we further propose a novel hierarchical approximate algorithm. With the help of the Delaunay triangulation for graph construction from point clouds and a multi-scale U-Net for segmentation, we manage to demonstrate the state-of-the-art performance on ShapeNet and PartNet, respectively, with significant improvement over the literature. Code is available at https://github.com/Zhang-VISLab.
研究动机与目标
- 为解决将3D点云有效且高效地投影到2D图像空间的挑战,使传统2D卷积神经网络可用于语义分割。
- 在投影过程中保持3D点云的拓扑结构,避免局部几何模式的损失。
- 通过引入分层近似算法,加速计算成本较高的图绘制过程。
- 证明当应用于经过适当投影的3D点云图像时,标准2D卷积神经网络可超越专用的3D深度学习模型。
- 通过统一的处理流程,在ShapeNet和PartNet等基准数据集上实现最先进性能。
提出的方法
- 使用Delaunay三角剖分从3D点云构建图,以编码局部几何关系。
- 将图绘制重新表述为整数规划问题,以学习从3D图到2D网格的拓扑保持映射。
- 提出一种新颖的分层近似算法,时间复杂度为O(n^(L+1)/L),相比精确方法将计算时间减少约97%。
- 通过学习到的映射将3D点投影到2D网格上,生成(x,y,z)-图像,空单元填充为零。
- 对(x,y,z)-图像应用多尺度U-Net进行语义分割,利用2D卷积神经网络的局部感受野。
- 以Kamada-Kawai算法为基础,通过整数规划将能量驱动的图布局优化适配到离散2D网格。
实验结果
研究问题
- RQ1当提供合适的2D图像表示时,传统2D卷积神经网络是否能在3D点云分割任务中实现最先进性能?
- RQ2如何在将3D点云投影到2D图像空间的过程中保持其结构,以维持局部几何模式?
- RQ3如何设计一种高效且可扩展的方法,以计算大规模3D点云的拓扑保持图到网格映射?
- RQ4分层近似是否能显著降低图绘制的计算成本,同时不损失分割精度?
- RQ5所提出方法在标准基准测试中与现有3D专用深度学习模型相比表现如何?
主要发现
- 所提方法在ShapeNet上实现最先进性能,所有先前方法均被超越,平均交并比(mIoU)达到63.0%。
- 在PartNet上,该方法在三个不同分割层级上分别提升6.8%、9.1%和5.9%,平均提升3.2%,实现最先进水平。
- 在ShapeNet上,该方法实现88.6%的类别mIoU和65.2%的实例mIoU,显著优于先前最先进结果。
- 分层近似将运行时间相比精确整数规划解法减少了约97%。
- 在PartNet所有层级的50个类别中,该方法在31个类别上表现最佳,展现出强大的鲁棒性和泛化能力。
- 多尺度U-Net架构能有效捕捉投影后(x,y,z)-图像中的局部上下文信息,从而显著提升分割精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。