Skip to main content
QUICK REVIEW

[论文解读] 3D-SIS: 3D Semantic Instance Segmentation of RGB-D Scans

Ji Hou, Angela Dai|arXiv (Cornell University)|Dec 17, 2018
Image and Object Detection Techniques参考文献 39被引用 21
一句话总结

3D-SIS 提出了一种新颖的端到端深度学习框架,用于在 RGB-D 扫描中进行 3D 语义实例分割,通过姿态对齐的多视角输入,联合融合 2D RGB 特征与 3D 几何特征。该方法在真实世界的 ScanNetV2 基准测试中实现了最先进性能,通过全卷积架构实现单次推理,mAP 提升超过 13 个百分点,适用于完整 3D 场景。

ABSTRACT

We introduce 3D-SIS, a novel neural network architecture for 3D semantic instance segmentation in commodity RGB-D scans. The core idea of our method is to jointly learn from both geometric and color signal, thus enabling accurate instance predictions. Rather than operate solely on 2D frames, we observe that most computer vision applications have multi-view RGB-D input available, which we leverage to construct an approach for 3D instance segmentation that effectively fuses together these multi-modal inputs. Our network leverages high-resolution RGB input by associating 2D images with the volumetric grid based on the pose alignment of the 3D reconstruction. For each image, we first extract 2D features for each pixel with a series of 2D convolutions; we then backproject the resulting feature vector to the associated voxel in the 3D grid. This combination of 2D and 3D feature learning allows significantly higher accuracy object detection and instance segmentation than state-of-the-art alternatives. We show results on both synthetic and real-world public benchmarks, achieving an improvement in mAP of over 13 on real-world data.

研究动机与目标

  • 解决在真实世界 RGB-D 扫描中进行 3D 语义实例分割的挑战,因为单图方法难以捕捉空间一致性。
  • 利用消费级传感器(如 Kinect)获取的多视角 RGB-D 输入,提升 3D 目标检测与实例分割的准确性。
  • 开发一种全卷积 3D 网络,实现在大规模 3D 环境中高效、单次推理。
  • 通过姿态对齐的特征融合,联合学习颜色(RGB)与几何(符号距离场)信号。
  • 通过引入 3D 空间上下文,克服 2D 实例分割模型(如 Mask R-CNN)在投影到 3D 时的局限性。

提出的方法

  • 使用已知 6DoF 姿态的多视角 RGB-D 序列,通过符号距离场重建 3D 体素网格。
  • 通过一系列 2D 卷积从每个 RGB 帧中提取 2D 特征,然后利用姿态对齐将这些特征反投影到 3D 体素网格中。
  • 使用 3D 卷积和残差块,在共享的 3D 特征空间中融合 2D 颜色特征与 3D 几何特征。
  • 采用 3D 区域提议网络(3D-RPN)和 3D RoI 池化层,生成带有边界框、类别标签和逐体素实例掩码的对象提议。
  • 通过边界框回归、目标分类和语义实例掩码预测的联合损失,端到端训练整个网络。
  • 采用全卷积设计,实现在无需分块或裁剪的情况下,对完整 3D 扫描进行高效、单次推理。

实验结果

研究问题

  • RQ1与仅使用单一模态的方法相比,联合学习 2D RGB 与 3D 几何特征是否能提升 3D 实例分割的准确性?
  • RQ2利用姿态对齐的多视角 RGB-D 输入是否能带来更好的空间一致性和 3D 实例分割性能?
  • RQ3全卷积 3D 网络是否能实现在大规模 3D 场景中高精度、单次推理的实例分割?
  • RQ4输入视角数量(1、3、5)在真实世界与合成环境中如何影响 3D 实例分割的性能?
  • RQ5在基准数据集上,3D-SIS 在投影到 3D 空间后,与基于 2D 的模型(如 Mask R-CNN)相比,性能提升程度如何?

主要发现

  • 在真实世界的 ScanNetV2 数据集上,3D-SIS 相较于最先进方法 mAP 提升 13.5 个百分点,当使用五张视角时,最终 mAP@0.5 达到 40.2。
  • 在合成的 SUNCG 数据集上,3D-SIS 实现 32.2 mAP@0.25 和 24.7 mAP@0.5,优于 Frustum PointNet 和投影到 3D 的 Mask R-CNN 等先前方法。
  • 消融研究显示,增加视角数量(从 1 到 5)能持续提升性能,ScanNetV2 上 mAP@0.5 从 18.7 提升至 22.5。
  • 仅使用几何特征(geo only)训练的模型在 ScanNetV2 上达到 27.6 mAP@0.5,但加入 RGB 特征后性能显著提升。
  • 全卷积设计使模型能够对完整 3D 扫描实现单次推理,适用于实时与大规模应用场景。
  • 3D-SIS 在 ScanNetV2 3D 实例分割基准上优于同期最先进方法,包括 MTML、3D-BEVIS 和 R-PointNet。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。