Skip to main content
QUICK REVIEW

[论文解读] Unseen Object Instance Segmentation for Robotic Environments

Christopher Xie, Xiang Yu|arXiv (Cornell University)|Jul 16, 2020
Robot Manipulation and Learning参考文献 85被引用 10
一句话总结

该论文提出UOIS-Net,一种基于合成RGB-D数据的两阶段深度学习框架,用于机器人桌面上未见过物体的实例分割。首先仅使用深度信息通过中心投票回归生成粗略掩码,然后利用RGB信息进行细化,即使在训练时使用非真实感的合成RGB图像,也能实现对真实世界未见过物体的最先进泛化性能。

ABSTRACT

In order to function in unstructured environments, robots need the ability to recognize unseen objects. We take a step in this direction by tackling the problem of segmenting unseen object instances in tabletop environments. However, the type of large-scale real-world dataset required for this task typically does not exist for most robotic settings, which motivates the use of synthetic data. Our proposed method, UOIS-Net, separately leverages synthetic RGB and synthetic depth for unseen object instance segmentation. UOIS-Net is comprised of two stages: first, it operates only on depth to produce object instance center votes in 2D or 3D and assembles them into rough initial masks. Secondly, these initial masks are refined using RGB. Surprisingly, our framework is able to learn from synthetic RGB-D data where the RGB is non-photorealistic. To train our method, we introduce a large-scale synthetic dataset of random objects on tabletops. We show that our method can produce sharp and accurate segmentation masks, outperforming state-of-the-art methods on unseen object instance segmentation. We also show that our method can segment unseen objects for robot grasping.

研究动机与目标

  • 使机器人能够在未接触过的新环境下识别并分割未见过的物体实例。
  • 解决缺乏大规模真实世界未见过物体实例分割数据集的问题。
  • 通过在合成数据上进行训练,弥合模拟到真实世界的域差距,实现在真实世界场景中的强泛化能力。
  • 开发一种方法,利用深度信息实现鲁棒的实例定位,同时利用RGB信息实现精细的边界细化,即使在非真实感的合成RGB图像上也能有效工作。

提出的方法

  • UOIS-Net采用两阶段架构:首先,深度播种网络(DSN)从合成深度图像中回归2D或3D中心投票,生成初始粗略掩码。
  • DSN仅在合成深度数据上进行训练,即使存在噪声和域偏移,也能实现对真实世界深度传感器的强泛化能力。
  • 其次,区域细化网络(RRN)接收初始掩码和非真实感的合成RGB输入,对物体边界进行细化,生成清晰准确的实例掩码。
  • RRN在非真实感的合成RGB上进行训练,但能有效泛化到真实世界RGB,得益于其局部化、掩码条件的细化任务。
  • 该方法使用大规模合成数据集Tabletop Object Dataset(TOD),通过PyBullet生成,包含随机ShapeNet物体放置在桌面上的场景。
  • 对中心投票应用后处理聚类以形成初始实例掩码,随后通过RRN进行像素级细化。

实验结果

研究问题

  • RQ1是否一种将深度与RGB处理分离的两阶段网络,相比端到端方法,在真实世界机器人环境中对未见过物体的泛化能力更优?
  • RQ2在非真实感的合成RGB上训练的细化网络,是否能在无需域适应或域随机化的情况下,有效泛化到真实世界RGB?
  • RQ3与仅使用RGB或联合使用RGB-D的方法相比,仅使用深度的中心投票在抗噪声和域偏移方面表现如何?
  • RQ4仅在合成数据上训练的模型,是否能在无需真实数据微调的情况下,实现在真实世界未见过物体实例分割上的强性能?
  • RQ5在杂乱的真实世界桌面场景中,基于深度的实例分割的主要失败模式是什么?

主要发现

  • 尽管在合成TOD测试集上表现较差,UOIS-Net-2D和UOIS-Net-3D在真实世界测试数据上仍优于Mask R-CNN和PointGroup等SOTA方法。
  • 在真实世界数据上,UOIS-Net-2D在重叠指标上达到90.9%的F1分数,在边界指标上达到84.1%,优于Mask R-CNN和PointGroup。
  • 区域细化网络(RRN)的泛化能力几乎等同于在真实数据上训练的模型,表明掩码细化任务对RGB真实感的敏感度低于端到端分割。
  • 在真实世界实验中,该方法在51个未见过物体上的抓取成功率达到80.3%,失败主要源于分割错误或抓取生成不准确。
  • 常见失败模式包括对紧密排列或平面表面物体的分割不足,以及对非凸物体(如电钻)的过度分割。
  • 该框架对噪声深度传感器表现出鲁棒性,并能有效利用RGB信息进行边界细化,即使合成RGB图像非真实感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。