Skip to main content
QUICK REVIEW

[论文解读] ClusterNet: Instance Segmentation in RGB-D Images

Lin Shao, Ye Tian|arXiv (Cornell University)|Jul 24, 2018
Advanced Neural Network Applications参考文献 18被引用 13
一句话总结

ClusterNet 提出了一种基于物体占据函数的一阶和二阶矩来表示物体实例的 RGB-D 图像实例分割方法。该方法采用沙漏形深度神经网络,预测三维物体中心、尺寸和姿态,最终通过在矩空间中聚类实现分割——在合成数据集上达到最先进性能,并在真实世界数据上表现出强大的泛化能力。

ABSTRACT

We propose a method for instance-level segmentation that uses RGB-D data as input and provides detailed information about the location, geometry and number of individual objects in the scene. This level of understanding is fundamental for autonomous robots. It enables safe and robust decision-making under the large uncertainty of the real-world. In our model, we propose to use the first and second order moments of the object occupancy function to represent an object instance. We train an hourglass Deep Neural Network (DNN) where each pixel in the output votes for the 3D position of the corresponding object center and for the object's size and pose. The final instance segmentation is achieved through clustering in the space of moments. The object-centric training loss is defined on the output of the clustering. Our method outperforms the state-of-the-art instance segmentation method on our synthesized dataset. We show that our method generalizes well on real-world data achieving visually better segmentation results.

研究动机与目标

  • 为自主机器人应用实现 RGB-D 场景中的精确实例级分割。
  • 利用占据函数的几何矩(一阶与二阶)对物体实例进行建模,以提升三维定位与形状估计性能。
  • 开发一种可微的、以物体为中心的训练损失,作用于聚类后的输出,以提升分割精度。
  • 实现从合成数据到真实世界 RGB-D 数据的鲁棒泛化。
  • 为决策制定提供关于物体位置、几何形状与姿态的详细、逐实例信息,尤其适用于不确定环境。

提出的方法

  • 该方法使用物体占据函数的一阶与二阶矩来表征每个物体实例,编码其中心、尺寸与方向。
  • 采用沙漏形深度神经网络,为每个像素预测三维空间中的物体中心与几何参数。
  • 通过基于预测矩向量在矩空间中对像素进行聚类,实现实例分割。
  • 训练损失定义于最终聚类输出之上,实现分割任务的端到端优化。
  • 模型在合成的 RGB-D 数据集上进行训练,其中包含合成物体放置与真实场景背景。
  • 该方法同时利用 RGB 与深度信息,以提升三维实例定位与形状估计性能。

实验结果

研究问题

  • RQ1基于矩的物体实例表征是否能提升 RGB-D 数据中的三维实例分割性能?
  • RQ2在矩空间中进行聚类是否比直接像素级预测能带来更准确、更鲁棒的实例分割?
  • RQ3在合成 RGB-D 数据上训练的模型是否能有效泛化到真实世界场景?
  • RQ4与标准分割损失相比,以物体为中心的训练损失如何提升分割性能?
  • RQ5同时使用 RGB 与深度数据对实例分割精度与几何细节有何影响?

主要发现

  • ClusterNet 在合成 RGB-D 数据集上超越了当前最先进实例分割方法,展现出更优的实例定位与分割精度。
  • 该方法在真实世界 RGB-D 数据上泛化良好,相比基线方法产生更优的视觉分割结果。
  • 基于矩的表征使模型能够通过一次前向传播精确估计物体中心、尺寸与姿态。
  • 基于聚类的后处理步骤能有效根据几何一致性将像素分组为连贯的物体实例。
  • 以物体为中心的训练损失通过直接优化分割质量,使实例预测更加一致与准确。
  • 该模型仅使用 RGB 与深度输入即可实现高质量实例分割,无需额外监督或实例特定嵌入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。