Skip to main content
QUICK REVIEW

[论文解读] Box2Seg: Learning Semantics of 3D Point Clouds with Box-Level Supervision

Yan Liu, Qingyong Hu|arXiv (Cornell University)|Jan 9, 2022
3D Shape Modeling and Analysis被引用 6
一句话总结

Box2Seg 提出了一种仅使用边界框级标注和子云级标签的弱监督3D点云语义分割框架,通过基于注意力的自训练和点类激活映射生成前景与背景点的精确伪标签。该方法在S3DIS和ScanNet上实现了具有竞争力的性能——与全监督基线模型相当或更优,且监督程度极低。

ABSTRACT

Learning dense point-wise semantics from unstructured 3D point clouds with fewer labels, although a realistic problem, has been under-explored in literature. While existing weakly supervised methods can effectively learn semantics with only a small fraction of point-level annotations, we find that the vanilla bounding box-level annotation is also informative for semantic segmentation of large-scale 3D point clouds. In this paper, we introduce a neural architecture, termed Box2Seg, to learn point-level semantics of 3D point clouds with bounding box-level supervision. The key to our approach is to generate accurate pseudo labels by exploring the geometric and topological structure inside and outside each bounding box. Specifically, an attention-based self-training (AST) technique and Point Class Activation Mapping (PCAM) are utilized to estimate pseudo-labels. The network is further trained and refined with pseudo labels. Experiments on two large-scale benchmarks including S3DIS and ScanNet demonstrate the competitive performance of the proposed method. In particular, the proposed network can be trained with cheap, or even off-the-shelf bounding box-level annotations and subcloud-level tags.

研究动机与目标

  • 解决在缺乏完整点级标注或其成本过高的情况下,从最小监督中学习密集3D点级语义的挑战。
  • 探索在大规模3D数据集中常见但尚未被充分利用的边界框级标注在弱监督语义分割中的潜力。
  • 开发一种框架,利用边界框内和边界框外的几何与拓扑先验,为前景和背景点生成可靠的伪标签。
  • 证明框架对噪声或不准确边界框标注的鲁棒性,支持在真实世界中存在不完美标注的场景下实际部署。

提出的方法

  • 采用基于注意力的自训练(AST)流程,通过建模空间依赖性和特征注意力,为边界框内前景点生成初始伪标签。
  • 利用点类激活映射(PCAM)定位判别性区域,并通过突出显著点特征来优化前景伪标签。
  • 训练一个专用点分类器,从PCAM中挖掘定位线索,并为边界框外的背景点生成伪标签。
  • 应用一个精炼模块,通过置信度阈值和一致性检查过滤不可靠的伪标签,减少训练过程中的错误传播。
  • 使用精炼后的伪标签以全监督方式训练最终的分割网络,实现从弱监督到端到端学习的完整流程。
  • 整合来自边界框几何(如中心点、尺度和空间范围)的几何先验,以指导伪标签生成并提升定位精度。

实验结果

研究问题

  • RQ1仅依赖边界框级标注而无点级标签,是否足以训练出高性能的3D语义分割模型?
  • RQ2基于注意力的自训练与PCAM在边界框内前景点的伪标签生成中是否高效准确?
  • RQ3能否通过基于前景线索和结构先验训练的分类器,可靠地为边界框外的背景点生成伪标签?
  • RQ4该框架在真实数据集中常见的噪声或不准确边界框标注下是否具备鲁棒性?
  • RQ5该框架是否能在不同主干网络架构和大规模3D基准上实现良好泛化?

主要发现

  • Box2Seg 仅使用边界框和子云级监督,在S3DIS数据集的Area-5上实现了60.4%的平均交并比(mIoU),优于多个全监督基线模型,如PointNet++(52.3%)和PointCNN。
  • 该方法在噪声边界框条件下仍保持强性能:在±20%随机平移下mIoU仅下降至53.6%,在尺度扰动下为55.0%,表明对标注错误具有高度鲁棒性。
  • 伪标签精炼步骤对性能提升贡献最大,将mIoU从54.4%提升至60.4%,表明过滤不可靠预测对泛化至关重要。
  • 该框架在弱监督设置下实现了具有竞争力的结果——在S3DIS和ScanNet基准上与全监督模型(如PointNet++和PointCNN)相当或更优。
  • 当适配为PointNet++作为主干网络时,Box2Seg 仍达到44.5%的mIoU,表明其在不同网络架构间具备良好通用性,尽管受限于特征提取能力存在性能差距。
  • 消融研究证实,结合注意力调制、伪标签生成与精炼可获得最佳性能(60.4% mIoU),其中精炼模块影响最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。