Skip to main content
QUICK REVIEW

[论文解读] 6-DoF Grasp Planning using Fast 3D Reconstruction and Grasp Quality CNN

Yahav Avigal, Samuel Paradis|arXiv (Cornell University)|Sep 18, 2020
Robot Manipulation and Learning参考文献 7被引用 7
一句话总结

本文提出了一种6-DoF抓取规划系统,通过微调的Learnt Stereo Machine(LSM)实现多RGB相机的快速3D重建,并结合一种新型多视角抓取质量卷积神经网络(MV-GQ-CNN)。该方法通过融合来自不同视角的深度预测,实现了鲁棒抓取,在复杂家用物体上表现优于自上而下的抓取方法,对碗类物体的抓取质量得分为96%,在杂乱或非自上而下视角场景中性能也有所提升。

ABSTRACT

Recent consumer demand for home robots has accelerated performance of robotic grasping. However, a key component of the perception pipeline, the depth camera, is still expensive and inaccessible to most consumers. In addition, grasp planning has significantly improved recently, by leveraging large datasets and cloud robotics, and by limiting the state and action space to top-down grasps with 4 degrees of freedom (DoF). By leveraging multi-view geometry of the object using inexpensive equipment such as off-the-shelf RGB cameras and state-of-the-art algorithms such as Learn Stereo Machine (LSM\cite{kar2017learning}), the robot is able to generate more robust grasps from different angles with 6-DoF. In this paper, we present a modification of LSM to graspable objects, evaluate the grasps, and develop a 6-DoF grasp planner based on Grasp-Quality CNN (GQ-CNN\cite{mahler2017dex}) that exploits multiple camera views to plan a robust grasp, even in the absence of a possible top-down grasp.

研究动机与目标

  • 解决在非结构化、杂乱的家庭环境中,由于物体部分可见或未处于最优朝向,导致自上而下4-DoF抓取方法受限的问题。
  • 通过使用学习到的立体模型,从低成本RGB相机实现高保真3D重建,减少对昂贵深度相机的依赖。
  • 开发一种多视角抓取规划网络(MV-GQ-CNN),实现在非自上而下相机视角下的抓取质量预测泛化。
  • 证明LSM生成的深度图即使在自上而下视角无法获得有效抓取时,也能支持有效的6-DoF抓取规划。

提出的方法

  • 在与原始ShapeNet训练分布不同的可抓取家用物体的合成RGB图像上,对Learnt Stereo Machine(LSM)进行微调。
  • 使用可微渲染流水线自动化生成多视角合成RGB与深度图像对,以训练LSM用于可抓取物体的3D重建。
  • 设计了一种多视角GQ-CNN(MV-GQ-CNN),其接收来自多个摄像机视角的深度图,并输出具有高置信度的6-DoF抓取位姿。
  • 将LSM预测的深度图集成到GQ-CNN框架中,实现无需自上而下视角或昂贵深度传感器的抓取规划。
  • 采用交叉熵方法(CEM)在所有视角中采样并优化抓取候选,通过Q值预测选择置信度最高的抓取。
  • 使用真实深度图和LSM预测的深度图对系统进行评估,比较在不同物体拓扑结构下的抓取质量与鲁棒性。

实验结果

研究问题

  • RQ1微调后的LSM网络能否从家用物体的多张RGB图像中生成足够用于下游抓取规划的精确深度图?
  • RQ2与传统自上而下GQ-CNN相比,多视角GQ-CNN(MV-GQ-CNN)在具有复杂几何形状或非理想朝向的物体上进行6-DoF抓取规划时是否表现更优?
  • RQ3在抓取规划流程中,使用LSM预测的深度图替代真实深度图时,抓取质量是否能够保持或提升?
  • RQ4快速多视角重建与多视角抓取预测的结合是否适用于非结构化环境中实时、低成本的机器人抓取?

主要发现

  • 微调后的LSM在1-shot、3-shot和9-shot输入下均表现出一致的重建误差,数据集上的平均误差为0.002896,'上方'视角的误差为0.003527,表明对输入视角数量具有鲁棒性。
  • 在未见物体上,微调后的LSM优于预训练网络,尤其在洗发水瓶、NutellaGo包装等可抓取物品上表现更优,归因于其与训练分布更好的对齐。
  • MV-GQ-CNN在使用多视角输入时,对碗类物体的抓取质量得分为0.96,超过自上而下方法的0.87,证明在复杂物体上抓取更鲁棒。
  • 对于西葫芦类物体,多视角规划的Q值为0.96,而自上而下设置下为0.90,表明从多重视角获得的抓取质量置信度更高。
  • 在玩具椅上,自上而下方法因边缘分割失败而无法找到抓取(N/A),而多视角规划的Q值达到0.60,表明在困难情况下具有更高的可靠性。
  • 使用LSM预测的深度图时,抓取质量与真实深度图相当:例如,左上角抓取的Q值在真实深度图下为0.652,在预测深度图下为0.830,显示出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。