[论文解读] Multi-Path Region Mining For Weakly Supervised 3D Semantic Segmentation on Point Clouds
该论文提出了一种仅使用场景级或子云朵级标签的弱监督3D语义分割方法,引入了多路径区域挖掘(MPRM)模块,通过空间、通道和点级注意力机制,从弱监督分类网络生成精确的伪点级标签。该方法在ScanNet数据集上实现了41.1 mIoU的竞争力性能,超越了PointNet++和SPLATNet等全监督模型,证明了仅需极少标注成本即可实现弱监督3D分割的可行性。
Point clouds provide intrinsic geometric information and surface context for scene understanding. Existing methods for point cloud segmentation require a large amount of fully labeled data. Using advanced depth sensors, collection of large scale 3D dataset is no longer a cumbersome process. However, manually producing point-level label on the large scale dataset is time and labor-intensive. In this paper, we propose a weakly supervised approach to predict point-level results using weak labels on 3D point clouds. We introduce our multi-path region mining module to generate pseudo point-level label from a classification network trained with weak labels. It mines the localization cues for each class from various aspects of the network feature using different attention modules. Then, we use the point-level pseudo labels to train a point cloud segmentation network in a fully supervised manner. To the best of our knowledge, this is the first method that uses cloud-level weak labels on raw 3D space to train a point cloud semantic segmentation network. In our setting, the 3D weak labels only indicate the classes that appeared in our input sample. We discuss both scene- and subcloud-level weakly labels on raw 3D point cloud data and perform in-depth experiments on them. On ScanNet dataset, our result trained with subcloud-level labels is compatible with some fully supervised methods.
研究动机与目标
- 通过使用场景级或子云朵级标签等弱标签,降低全监督3D语义分割的高标注成本。
- 开发一种方法,从无点级标注的弱监督分类网络中生成准确的点级伪标签。
- 通过利用多路径注意力机制,提升在大物体主导场景中对小型或不占主导地位物体(如门、窗)的定位能力。
- 证明基于子云朵级标签的弱监督训练可超越场景级弱监督,并媲美部分全监督方法。
提出的方法
- 引入多路径区域挖掘(MPRM)模块,在分类主干网络之后应用三种注意力模块——空间、通道和点级空间注意力,以提取多样化的特征表示。
- 在每条注意力路径上应用点类激活映射(PCAM),以定位特定类别区域并生成伪掩码。
- 采用密集条件随机场(dCRF)通过引入低级特征和成对平滑性来优化伪标签。
- 使用优化后的伪标签以全监督方式训练完整的3D语义分割网络。
- 通过路径间伪标签的逐元素最大值融合策略,结合各路径预测结果,保持类别得分的平衡。
- 评估两种弱监督策略:场景级(整个场景中类别是否存在)和子云朵级(球形子采样中类别是否存在),其中子云朵级策略显著提升性能。
实验结果
研究问题
- RQ1能否仅使用云朵级标签(场景级或子云朵级)而非点级标注,有效训练弱监督3D语义分割?
- RQ2如何使一个使用弱标签训练的分类网络生成准确且定位精确的点级伪标签用于分割?
- RQ3与标准CAM相比,多路径注意力挖掘是否能提升对3D场景中小型或不占主导地位物体的定位能力?
- RQ4在分割性能方面,子云朵级弱监督与场景级监督相比表现如何?
- RQ5dCRF后处理的引入是否能进一步提升伪标签质量及下游分割精度?
主要发现
- 所提方法在ScanNet测试集上使用子云朵级弱监督实现了41.1 mIoU,优于PointNet++(33.9 mIoU)和SPLATNet(39.3 mIoU)等全监督模型。
- MPRM模块显著提升了对小型或不占主导地位类别(如门、窗)的性能,这些类别在标准CAM中常被忽略,尤其是在场景级监督下表现更明显。
- 空间注意力路径在单一路径中表现最佳,而将全部四条路径(原始PCAM + 三个注意力模块)结合后mIoU最高,证明了特征学习的互补性。
- 路径间伪标签的逐元素最大值融合优于逐元素求和融合,因为后者易受类别得分不平衡影响,从而主导最终预测。
- 使用伪标签微调完整分割网络的性能优于直接使用原始特征图,表明深层网络能从优化后的伪标签中获益。
- 使用子云朵级标签训练的模型显著优于使用场景级标签训练的模型,验证了子云朵级监督在降低标注成本的同时提升定位能力的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。