Skip to main content
QUICK REVIEW

[论文解读] 3D Shape Segmentation with Projective Convolutional Networks

Evangelos Kalogerakis, Melinos Averkiou|arXiv (Cornell University)|Dec 8, 2016
Industrial Vision Systems and Defect Detection被引用 10
一句话总结

该论文提出ShapePFCN,一种结合多视角全卷积网络(FCNs)与基于表面的条件随机场(CRFs)的深度学习框架,用于3D形状部件分割。通过使用几何一致的投影层将基于视图的预测投影到3D表面上,并利用CRF进行优化,该方法在ShapeNet基准上实现了最先进性能,相较于先前方法将平均标注准确率提升了约8%。

ABSTRACT

This paper introduces a deep architecture for segmenting 3D objects into their labeled semantic parts. Our architecture combines image-based Fully Convolutional Networks (FCNs) and surface-based Conditional Random Fields (CRFs) to yield coherent segmentations of 3D shapes. The image-based FCNs are used for efficient view-based reasoning about 3D object parts. Through a special projection layer, FCN outputs are effectively aggregated across multiple views and scales, then are projected onto the 3D object surfaces. Finally, a surface-based CRF combines the projected outputs with geometric consistency cues to yield coherent segmentations. The whole architecture (multi-view FCNs and CRF) is trained end-to-end. Our approach significantly outperforms the existing state-of-the-art methods in the currently largest segmentation benchmark (ShapeNet). Finally, we demonstrate promising segmentation results on noisy 3D shapes acquired from consumer-grade depth cameras.

研究动机与目标

  • 解决在不依赖手工调校的几何描述符或启发式规则的前提下,进行语义3D形状部件分割的挑战。
  • 实现对具有噪声、孔洞或复杂拓扑结构的3D形状的鲁棒且一致的分割。
  • 利用预训练的图像网络进行基于视图的推理,以提升泛化能力和部件检测性能。
  • 实现端到端训练统一架构,整合多视角CNN与表面CRF,确保标签的一致性。
  • 在干净的CAD模型和来自消费级深度传感器的真实扫描数据上均表现出色。

提出的方法

  • 从自动选择的视角渲染多个深度图与着色图,以最大化3D形状的表面覆盖度。
  • 使用共享的、预训练的全卷积网络(FCNs)处理每个视图,生成各部件的置信度图。
  • 通过可微分的、具备几何感知能力的投影层,将FCN输出投影到3D表面,保持空间一致性。
  • 利用学习到的融合机制,在多尺度与多视角之间聚合预测结果。
  • 应用基于表面的条件随机场(CRF),在全网格上强制实现几何一致性并平滑标签。
  • 在标注的3D形状数据集上,使用监督学习对整个架构(包括CRF)进行端到端训练。

实验结果

研究问题

  • RQ1能否通过多视角推理,有效重用预训练的基于图像的深度网络用于3D形状部件分割?
  • RQ2如何对多视角预测进行几何投影与融合,以生成一致的3D表面分割?
  • RQ3与仅依赖视图预测相比,学习到的表面CRF是否能提升分割的一致性与鲁棒性?
  • RQ4所提出的方法是否在大规模3D分割基准(如ShapeNet)上优于当前最先进方法?
  • RQ5该方法在来自消费级深度传感器的噪声真实扫描数据上的泛化能力如何?

主要发现

  • 在ShapeNetCore基准上,ShapePFCN实现了92.2%的平均标注准确率,相较于之前最先进方法提升了约8%。
  • 在PSB与COSEG数据集上,该方法在所有类别上实现了92.6%的平均准确率,优于ShapeBoost(90.6%)与Guo等人方法(86.3%)。
  • 该方法对噪声与网格退化具有鲁棒性,在传统方法失效的真实RGB-D扫描中仍能生成高质量分割结果。
  • 特别是,在COSEG_TeleAliens类别上达到95.7%的准确率,在PSB_Chair类别上达到98.5%,显著优于先前方法。
  • 表面CRF组件显著提升了标签的一致性,尤其在遮挡或模糊区域,定量与定性结果均证实了这一点。
  • 整个架构(包括CRF)的端到端训练,相比分阶段流水线,带来了更好的泛化能力与更一致的预测结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。