Skip to main content
QUICK REVIEW

[论文解读] Form2Fit: Learning Shape Priors for Generalizable Assembly from Disassembly

Kevin Zakka, Andy Zeng|arXiv (Cornell University)|Oct 30, 2019
Robot Manipulation and Learning参考文献 36被引用 14
一句话总结

Form2Fit 提出了一种自监督的、基于形状匹配的方法,通过使用孪生卷积网络学习物体表面与目标放置位置之间的几何对应关系,实现可泛化的机器人套件组装。该系统在不同初始条件下实现90%的成功率,在新套件配置下达到94%,对未见过的物体和套件的泛化能力超过86%,利用拆卸生成的训练数据实现零样本迁移,无需3D CAD模型或任务特定微调。

ABSTRACT

Is it possible to learn policies for robotic assembly that can generalize to new objects? We explore this idea in the context of the kit assembly task. Since classic methods rely heavily on object pose estimation, they often struggle to generalize to new objects without 3D CAD models or task-specific training data. In this work, we propose to formulate the kit assembly task as a shape matching problem, where the goal is to learn a shape descriptor that establishes geometric correspondences between object surfaces and their target placement locations from visual input. This formulation enables the model to acquire a broader understanding of how shapes and surfaces fit together for assembly -- allowing it to generalize to new objects and kits. To obtain training data for our model, we present a self-supervised data-collection pipeline that obtains ground truth object-to-placement correspondences by disassembling complete kits. Our resulting real-world system, Form2Fit, learns effective pick and place strategies for assembling objects into a variety of kits -- achieving $90\%$ average success rates under different initial conditions (e.g. varying object and kit poses), $94\%$ success under new configurations of multiple kits, and over $86\%$ success with completely new objects and kits.

研究动机与目标

  • 在无需3D CAD模型或任务特定训练数据的情况下,实现对新物体和套件的可泛化机器人组装。
  • 解决基于位姿的组装方法严重依赖精确6D物体位姿估计且难以泛化到新型配置的局限性。
  • 开发一种自监督的数据采集流水线,通过反转已完成套件的拆卸轨迹,自动生成高质量的训练数据。
  • 通过端到端训练学习一种可泛化的形状描述符,以编码物体与其目标放置位置之间的几何对应关系。
  • 在真实世界环境中评估系统在多样化初始条件、多套件配置以及未见过的物体和套件上的鲁棒性与泛化能力。

提出的方法

  • Form2Fit 将套件组装问题形式化为形状匹配问题,通过全卷积孪生网络学习像素级特征描述符,以匹配物体表面与目标放置位置。
  • 网络采用对比损失进行孪生式训练,鼓励真实物体-放置对应关系的描述符相似,同时引入正则化以提升泛化能力。
  • 自监督数据采集流水线通过自主拆卸已完成套件的试错式抓取-放置动作,然后反转动作序列,获得真实运动轨迹和对应关系。
  • 训练数据来自多个套件的真实世界拆卸过程,使模型能够学习到涵盖多样化物体和套件几何形状的广泛形状先验。
  • 系统使用RGB-D观测生成高度图,输入网络以预测空间对齐的描述符,用于匹配。
  • 推理阶段,系统选择描述符相似度最高的物体-放置配对,以确定最优抓取-放置动作。

实验结果

研究问题

  • RQ1是否可以学习到机器人组装策略,使其在无需3D CAD模型或任务特定训练数据的情况下泛化到新物体和套件?
  • RQ2从多样化套件组装任务中学到的形状先验在多大程度上能提升对未见配置和物体几何形状的泛化能力?
  • RQ3通过自监督拆卸而非人工示范或脚本化策略,是否可行生成高质量、大规模的套件组装训练数据?
  • RQ4系统对初始物体和套件位姿的变化(包括不同旋转和位移)有多强的鲁棒性?
  • RQ5系统能否泛化到多个套件的新组合以及训练期间未见过的全新物体?

主要发现

  • 在不同初始条件下(包括随机物体和套件位姿与朝向)的单体和多体套件中,系统实现了90%的平均成功率。
  • 在涉及多个套件混合的新配置中,系统达到了94.27%的成功率,表明对未见套件排列具有强大的泛化能力。
  • 对于训练期间未见过的全新物体和套件,系统成功率超过86%,表明对未见几何形状具备有效的零样本泛化能力。
  • t-SNE可视化证实,学习到的描述符编码了旋转、空间对应关系和物体身份,支持模型在物体变化下的泛化能力。
  • 失败原因主要为180°方向翻转或在几何形状相似的物体间混淆(如柠檬与草莓),表明在低分辨率观测下形状区分能力存在局限。
  • 自监督拆卸流水线通过反转自主拆卸的动作序列,成功生成高质量训练数据,实现了无需人工标注的大规模数据采集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。