Skip to main content
QUICK REVIEW

[论文解读] A Multi-task Convolutional Neural Network for Autonomous Robotic Grasping in Object Stacking Scenes

Hanbo Zhang, Xuguang Lan|arXiv (Cornell University)|Sep 19, 2018
Robot Manipulation and Learning参考文献 22被引用 6
一句话总结

本文提出了一种多任务卷积神经网络,将感知、推理与抓取执行整合于单一模型中,实现在复杂物体堆叠场景下的自主机器人抓取。通过联合检测物体与抓取姿态、推理视觉操作关系并规划抓取序列,该模型在Baxter机器人上使用RGB与深度输入,在杂乱、熟悉及复杂堆叠场景中分别实现了90.6%、71.9%和59.4%的成功率。

ABSTRACT

Autonomous robotic grasping plays an important role in intelligent robotics. However, how to help the robot grasp specific objects in object stacking scenes is still an open problem, because there are two main challenges for autonomous robots: (1)it is a comprehensive task to know what and how to grasp; (2)it is hard to deal with the situations in which the target is hidden or covered by other objects. In this paper, we propose a multi-task convolutional neural network for autonomous robotic grasping, which can help the robot find the target, make the plan for grasping and finally grasp the target step by step in object stacking scenes. We integrate vision-based robotic grasping detection and visual manipulation relationship reasoning in one single deep network and build the autonomous robotic grasping system. Experimental results demonstrate that with our model, Baxter robot can autonomously grasp the target with a success rate of 90.6%, 71.9% and 59.4% in object cluttered scenes, familiar stacking scenes and complex stacking scenes respectively.

研究动机与目标

  • 在目标被遮挡或隐藏的复杂、杂乱且遮挡严重的物体堆叠场景中,实现自主机器人抓取。
  • 解决在顺序抓取过程中正确推理抓取顺序以避免损坏其他物体的挑战。
  • 将基于视觉的物体检测、抓取候选预测与视觉操作关系推理整合到一个深度神经网络中。
  • 实现从RGB图像输入到机器人抓取控制的端到端执行,利用深度信息完成坐标变换。
  • 通过联合感知与推理,在多物体、遮挡严重及复杂堆叠环境中超越现有方法。

提出的方法

  • 设计了一种具有三个并行分支的多任务CNN架构:感知(物体检测与抓取候选预测)、推理(视觉操作关系预测)和抓取(抓取执行规划)。
  • 感知分支在局部区域检测物体及其抓取候选,避免全局图像级别的抓取检测。
  • 推理分支预测物体之间的视觉操作关系(例如“在……之上”、“在……之下”),以推断正确的抓取顺序。
  • 通过结合RGB输入用于推理与深度数据用于计算接近向量及坐标变换,实现抓取执行。
  • 在VMRD数据集上端到端训练网络,损失函数针对检测、关系预测与抓取质量进行优化。
  • 采用FCGN与VMRN的级联基线进行对比,证明了联合学习的优势。

实验结果

研究问题

  • RQ1单一深度神经网络能否有效结合物体检测、抓取候选预测与视觉操作关系推理,实现在复杂场景中的自主抓取?
  • RQ2感知与推理的联合学习在遮挡或杂乱堆叠场景中如何提升抓取成功率?
  • RQ3该模型在不同场景复杂度下的泛化能力如何,包括物体杂乱、熟悉堆叠与复杂堆叠?
  • RQ4在依赖RGB进行感知与推理的同时,集成深度信息对抓取执行有何影响?
  • RQ5在真实机器人实验中,所提出的多任务网络相比级联基线表现如何?

主要发现

  • 所提模型在物体杂乱场景中实现了90.6%的成功率,显著优于基线的43.8%。
  • 在熟悉堆叠场景中,模型达到71.9%的成功率,而基线为28.1%。
  • 在包含6–9个物体的复杂堆叠场景中,模型实现59.4%的成功率,超过基线的6.3%。
  • 失败分析表明,检测错误主要源于目标检测置信度低(如眼镜),抓取混淆源于物体重叠,以及抓取预测范围过大。
  • 即使目标不可见,模型仍能通过推理操作关系并按顺序移动可见物体,成功推断抓取顺序。
  • 将感知、推理与抓取规划整合于单一网络,实现了在复杂、遮挡环境中稳健的顺序抓取。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。