Skip to main content
QUICK REVIEW

[论文解读] ClusterNet: 3D Instance Segmentation in RGB-D Images

Lin Shao, Ye Tian|arXiv (Cornell University)|Jul 24, 2018
Industrial Vision Systems and Defect Detection被引用 11
一句话总结

ClusterNet 提出了一种无需区域提议的 3D 实例分割方法,用于 RGB-D 图像,通过回归对象占据函数的一阶和二阶矩来表示对象中心、尺寸和位姿。该方法使用钟形深度神经网络进行训练,并在矩量空间中通过聚类进行优化,在合成数据集上实现了最先进性能,并且无需微调即可稳健地泛化到真实世界数据。

ABSTRACT

We propose a method for instance-level segmentation that uses RGB-D data as input and provides detailed information about the location, geometry and number of individual objects in the scene. This level of understanding is fundamental for autonomous robots. It enables safe and robust decision-making under the large uncertainty of the real-world. In our model, we propose to use the first and second order moments of the object occupancy function to represent an object instance. We train an hourglass Deep Neural Network (DNN) where each pixel in the output votes for the 3D position of the corresponding object center and for the object's size and pose. The final instance segmentation is achieved through clustering in the space of moments. The object-centric training loss is defined on the output of the clustering. Our method outperforms the state-of-the-art instance segmentation method on our synthesized dataset. We show that our method generalizes well on real-world data achieving visually better segmentation results.

研究动机与目标

  • 解决在对象数量未知、杂乱遮挡场景下的 3D 实例分割挑战。
  • 通过利用深度数据和显式的 3D 对象特征表示,提升真实世界机器人感知中的鲁棒性与准确性。
  • 消除对区域提议的依赖,避免在严重遮挡或对象重叠时失效。
  • 实现在无需微调的情况下,从合成数据到真实世界 RGB-D 数据的泛化能力。
  • 为实时机器人决策提供可扩展、以对象为中心的框架。

提出的方法

  • 该模型使用钟形深度神经网络,为每个像素预测其所属对象的一阶矩(对象中心)和二阶矩(尺寸与位姿)。
  • 通过在由预测矩量定义的 3D 特征空间中进行顺序聚类,推断对象实例。
  • 网络采用以对象为中心的损失函数进行训练,该损失函数惩罚预测对象特征、方差以及实例唯一性违反的误差。
  • 输入模态包括 RGB、深度图和点云;模型利用深度图与点云数据以提升 3D 定位与分割性能。
  • 该方法避免使用区域提议,使每个像素能够访问超出边界框的全局上下文信息。
  • 损失函数包含加权项,用于中心点回归($\lambda_{p} = 100.0$)、特征方差($\lambda_{var} = 100.0$)和实例违反($\lambda_{vio} = 100.0$)。

实验结果

研究问题

  • RQ1无区域提议的深度学习框架能否在使用 RGB-D 数据的遮挡、杂乱场景中实现更优的 3D 实例分割性能?
  • RQ2与基于区域提议的方法相比,显式回归 3D 对象矩量(中心、尺寸、位姿)在准确性和鲁棒性方面表现如何?
  • RQ3融合深度图与点云数据在多大程度上提升了实例分割在真实世界数据上的泛化能力?
  • RQ4模型能否在无需微调的情况下实现从合成数据到真实世界数据的泛化?
  • RQ5在矩量空间中进行聚类是否能有效恢复实例身份,同时保持排列不变性?

主要发现

  • 我们的(c) 和 Our(c+cov) 模型在合成数据集上优于 Mask R-CNN(C4),其中 Our(c) 在所有遮挡水平下均达到最高的 AP 和 AR。
  • 与 Mask R-CNN(C4) 相比,该模型在严重遮挡对象上的平均召回率高出 15.6%,展现出更优的鲁棒性。
  • 引入深度图与点云输入(Our(rgbxyz→c))相比仅使用 RGB 输入(Our(rgb→c))在实例分割性能上取得显著提升。
  • Our(c) 在大尺寸对象上的表现优于 Our(rgbxyz→c),表明深度图为分割大尺度实例提供了关键线索。
  • 在真实世界数据上,Our(c) 能够以高精度成功分割多个对象,而 Mask R-CNN(C4) 完全失效,将整张图像分割为单一实例。
  • 该模型在无需微调的情况下实现了对真实世界数据的良好泛化,展现出强大的零样本迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。