[论文解读] Compositional Prototype Network with Multi-view Comparision for Few-Shot Point Cloud Semantic Segmentation
该论文提出了一种基于多视图对比(MVC)组件的组合原型网络(Compositional Prototype Network),用于少样本3D点云语义分割,通过利用局部区域表征和多视角嵌入,提升少样本泛化能力。该方法在新提出的ScanNet-$6^i$基准上实现了最先进性能,在1-shot设置下相比基线模型最高提升3.7%的平均mIoU,并在全监督设置下有效缓解了类别不平衡问题。
Point cloud segmentation is a fundamental visual understanding task in 3D vision. A fully supervised point cloud segmentation network often requires a large amount of data with point-wise annotations, which is expensive to obtain. In this work, we present the Compositional Prototype Network that can undertake point cloud segmentation with only a few labeled training data. Inspired by the few-shot learning literature in images, our network directly transfers label information from the limited training data to unlabeled test data for prediction. The network decomposes the representations of complex point cloud data into a set of local regional representations and utilizes them to calculate the compositional prototypes of a visual concept. Our network includes a key Multi-View Comparison Component that exploits the redundant views of the support set. To evaluate the proposed method, we create a new segmentation benchmark dataset, ScanNet-$6^i$, which is built upon ScanNet dataset. Extensive experiments show that our method outperforms baselines with a significant advantage. Moreover, when we use our network to handle the long-tail problem in a fully supervised point cloud segmentation dataset, it can also effectively boost the performance of the few-shot classes.
研究动机与目标
- 解决全监督3D点云语义分割对数据的高需求问题,该问题需要昂贵的逐点标注。
- 克服直接将基于图像的少样本学习方法迁移至点云时因结构和区域信息丢失而带来的局限性。
- 开发一种利用局部区域表征和多视角冗余信息以提升3D分割中少样本泛化能力的方法。
- 构建一个新基准ScanNet-$6^i$,用于在真实数据稀缺和类别不平衡条件下评估少样本点云分割性能。
- 证明所提出的少样本框架也可在全监督训练中提升稀有类别上的性能。
提出的方法
- 组合原型网络将复杂的点云数据分解为局部区域表征,以保留空间和结构信息。
- 多视图对比(MVC)组件从支持集的区域特征生成卷积核权重,实现将区域级别的标签传递至查询点。
- MVC组件利用支持集的多个视角生成鲁棒且具有判别性的核权重,从而提升泛化能力和效率。
- 该方法采用图注意力单元(GAU)来优化组合原型,并使用内积或卷积操作计算查询特征与原型之间的相似度。
- 构建了一个新基准ScanNet-$6^i$,基于ScanNet数据集,每轮任务包含6个类别,旨在评估在类别不平衡条件下的少样本分割性能。
- 通过将SparseConvNet的分类器修改为基于原型的度量学习并引入MVC,将框架扩展至全监督学习,无需数据重加权或过采样即可提升稀有类别性能。
实验结果
研究问题
- RQ1与全局原型池化相比,局部区域表征和多视图对比是否能显著提升3D点云分割中的少样本泛化能力?
- RQ2在3D分割中,所提出的多视图对比组件在效率和准确率方面与标准度量学习和基于关系的方法相比如何?
- RQ3该少样本框架在类别不平衡的3D分割数据集中,能在多大程度上缓解稀有类别性能下降的问题?
- RQ4该方法在不同样本设置(1-shot与5-shot)下是否具备泛化能力,并在数据稀缺条件下保持鲁棒性?
- RQ5基于MVC的度量学习框架是否可有效迁移至全监督训练,以提升少样本类别的性能?
主要发现
- 所提出的CP-MVC方法在1-shot的ScanNet-$6^i$基准上达到43.4%的mIoU,显著优于基线方法GAP(41.6%)和CP(41.9%)。
- 在5-shot设置下,该方法在ScanNet-$6^i$上达到45.1%的mIoU,比次优基线(44.3%)高出0.8个百分点。
- 消融实验表明,MVC优于内积和卷积相似度度量,具有更低的MACs(乘加操作数)和更好的泛化能力,尤其在融合多个视角时表现更优。
- 该方法在全监督训练中显著提升了少样本类别的性能:所提出的基于度量的方法在少样本类别上达到69.7%的mIoU(对比SparseConvNet的67.8%),整体mIoU达到72.7%,优于先前最先进方法。
- 与标准卷积相似度层相比,MVC组件降低了计算成本,多视角核生成带来的额外开销可忽略不计。
- 可视化结果表明,模型仅依赖一个支持样本即可成功将物体从背景中分割出来,展示了强大的少样本泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。