Skip to main content
QUICK REVIEW

[论文解读] Synergies Between Affordance and Geometry: 6-DoF Grasp Detection via Implicit Representations

Zhenyu Jiang, Yifeng Zhu|arXiv (Cornell University)|Apr 4, 2021
Robot Manipulation and Learning参考文献 56被引用 6
一句话总结

该论文提出GIGA,一种统一的深度学习框架,通过隐式神经表示联合学习6-DoF抓取检测与3D重建。通过利用截断符号距离函数(TSDF)体素网格中的共享可微特征,模型充分利用了抓取可操作性与几何结构之间的协同效应,在模拟和真实世界杂乱环境移除任务中,抓取成功率较基线提升10%以上。

ABSTRACT

Grasp detection in clutter requires the robot to reason about the 3D scene from incomplete and noisy perception. In this work, we draw insight that 3D reconstruction and grasp learning are two intimately connected tasks, both of which require a fine-grained understanding of local geometry details. We thus propose to utilize the synergies between grasp affordance and 3D reconstruction through multi-task learning of a shared representation. Our model takes advantage of deep implicit functions, a continuous and memory-efficient representation, to enable differentiable training of both tasks. We train the model on self-supervised grasp trials data in simulation. Evaluation is conducted on a clutter removal task, where the robot clears cluttered objects by grasping them one at a time. The experimental results in simulation and on the real robot have demonstrated that the use of implicit neural representations and joint learning of grasp affordance and 3D reconstruction have led to state-of-the-art grasping results. Our method outperforms baselines by over 10% in terms of grasp success rate. Additional results and videos can be found at https://sites.google.com/view/rpl-giga2021

研究动机与目标

  • 解决仅使用机载深度传感在杂乱、部分观测的3D场景中实现鲁棒6-DoF抓取检测的挑战。
  • 利用3D重建与抓取可操作性学习之间的协同关系,提升泛化能力与性能表现。
  • 开发一种可微的、连续的隐式表示,以支持抓取预测与几何重建的多任务联合训练。
  • 通过联合监督,动态分配表示能力至可抓取区域,提升遮挡区域的抓取成功率。
  • 在模拟环境与真实机器人上验证该方法在真实世界杂乱环境移除任务中的有效性。

提出的方法

  • 模型使用从输入深度图像生成的截断符号距离函数(TSDF)体素网格作为结构化特征输入。
  • 通过学习的隐式函数,深度神经网络将局部3D坐标编码为连续、可微的特征。
  • 这些特征用于在查询点上同时预测抓取可操作性(抓取质量、方向、宽度)和二值占据(3D几何结构)。
  • 模型采用端到端多任务监督进行训练:模拟环境中自监督的抓取尝试,以及重建任务的真实几何标签。
  • 共享的结构化特征网格使模型能够自适应地将计算资源分配给高抓取可操作性区域。
  • 该框架支持两个任务的可微训练,实现共享表示的基于梯度的优化。

实验结果

研究问题

  • RQ1联合学习抓取可操作性与3D重建是否能提升在杂乱、部分观测场景中的6-DoF抓取检测性能?
  • RQ23D重建的监督如何增强在遮挡或低可见度区域的抓取预测能力?
  • RQ3抓取监督是否能提升3D重建质量,特别是在把手、边缘等可抓取区域?
  • RQ4隐式神经表示在部分观测条件下,能在多大程度上提升真实抓取任务中的泛化能力与鲁棒性?
  • RQ5将表示能力动态分配给与动作相关区域,是否能带来可测量的性能提升?

主要发现

  • 在真实世界实验中,GIGA在Pile基准上达到86.9%的抓取成功率(GSR),在Packed基准上达到83.3%,较VGN基线提升超过10%。
  • 模型在部分遮挡物体上表现更优,成功检测到基线模型遗漏的可抓取部分,如边缘和把手。
  • 在可抓取区域,重建质量得到提升:GIGA比GIGA-Geo更完整地重建了水杯把手,后者则忽略或欠拟合了该区域。
  • 消融实验表明,GIGA-Geo(仅几何)产生更精确的全局重建,但GIGA(联合)更好地保留了可抓取部分,表明抓取监督引导特征学习朝向与动作相关的几何结构。
  • GIGA在IoU-Grasp与IoU之间的性能差距在所有方法中最大,表明抓取监督能动态将表示能力分配至高可操作性区域。
  • 失败案例主要源于接触表面不足,表明训练期间使用的模拟接触与摩擦模型存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。