[论文解读] Instance Segmentation of Visible and Occluded Regions for Finding and Picking Target from a Pile of Objects
本文提出了一种机器人系统,通过实例遮挡分割技术从杂乱堆叠的物体中寻找并抓取目标物体。该系统采用一种新颖的'relook'架构,联合预测物体的可见与被遮挡区域,通过建模实例间的相互关系来提升遮挡推理能力。系统利用合成数据生成技术,消除了对人工标注数据集的依赖,在遮挡感知实例分割任务中达到最先进性能,实现了在复杂遮挡场景下的真实世界抓取成功。
We present a robotic system for picking a target from a pile of objects that is capable of finding and grasping the target object by removing obstacles in the appropriate order. The fundamental idea is to segment instances with both visible and occluded masks, which we call `instance occlusion segmentation'. To achieve this, we extend an existing instance segmentation model with a novel `relook' architecture, in which the model explicitly learns the inter-instance relationship. Also, by using image synthesis, we make the system capable of handling new objects without human annotations. The experimental results show the effectiveness of the relook architecture when compared with a conventional model and of the image synthesis when compared to a human-annotated dataset. We also demonstrate the capability of our system to achieve picking a target in a cluttered environment with a real robot.
研究动机与目标
- 使机器人能够从高度遮挡的物体堆中识别并抓取目标物体,例如在堆叠、重叠物品的料箱中。
- 解决当目标被障碍物遮挡时,规划正确抓取顺序的挑战,需要推断不可见的物体区域。
- 通过数据合成框架生成具有真实遮挡模式和真实掩码的合成数据,消除对人工标注数据集的依赖。
- 开发一种深度学习模型,显式建模实例间的相互关系,以提升对可见和被遮挡物体部分的分割性能。
- 在高度遮挡的真实世界机器人抓取任务中,验证系统的有效性。
提出的方法
- 提出一种新颖的'relook'架构,通过建模物体实例之间的密度和空间关系,增强实例分割能力,从而更准确预测被遮挡区域。
- 利用图像合成技术,从单个物体实例图像生成多样化的堆叠配置,生成包含可见和被遮挡区域真实掩码的合成数据集。
- 在合成数据上端到端训练模型,实现对新物体的零样本泛化,无需人工标注。
- 使用多类别分割头,为每个实例预测可见和被遮挡的掩码,将标准实例分割扩展为可处理遮挡的独立类别。
- 采用基于阈值的遮挡比例(0.3)和实例间遮挡比例(0.1),判断哪些物体遮挡了目标物体。
- 主干网络采用ResNet101以提升特征提取能力,训练过程在3块GPU上进行学习率缩放,以保证公平比较。
实验结果
研究问题
- RQ1视觉系统是否能够在无需人工标注训练数据的情况下,学习预测杂乱场景中物体的被遮挡区域?
- RQ2与传统模型相比,建模实例间关系的relook架构在提升实例遮挡分割性能方面有多有效?
- RQ3合成数据生成是否能够产生足够的泛化能力,以替代遮挡感知实例分割中的人工标注数据集?
- RQ4该系统在高度遮挡的真实世界机器人操作任务中,能够在多大程度上实现正确的抓取顺序规划?
- RQ5该系统在涉及训练过程中未见过的新物体的真实世界抓取任务中表现如何?
主要发现
- relook架构的mPQ达到14.4,显著优于基线Softmax模型(13.4)和Softmax_x2(13.8),证明其在遮挡分割中的有效性。
- relook模型的mAP得分为48.6,超过Softmax(46.1)和Softmax_x2(47.1)基线,表明检测能力和可见掩码质量均得到提升。
- 合成数据集的mPQ为14.2,与人工标注数据集的mPQ(14.4)非常接近,证明了图像合成框架的有效性。
- 系统成功在真实世界中实现从物体堆中抓取目标物体,且能正确执行障碍物移除顺序(例如,先移除网球架,再移除哑铃)。
- 采用ResNet101作为主干网络提升了识别准确率,使系统在复杂真实世界杂乱场景中表现稳健。
- 系统通过0.3的遮挡比例阈值实现了可靠的遮挡推理,能够正确识别堆叠结构中被遮挡的目标物体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。