Skip to main content
QUICK REVIEW

[论文解读] GAPartNet: Cross-Category Domain-Generalizable Object Perception and Manipulation via Generalizable and Actionable Parts

Haoran Geng, Helin Xu|arXiv (Cornell University)|Nov 10, 2022
Robot Manipulation and Learning被引用 5
一句话总结

本文提出GAPartNet,一个大规模、以部件为中心的数据集,涵盖27个类别中1,166件物体的8,489个可泛化且可操作的部件(GAParts)。该研究提出一种基于对抗学习的领域泛化3D分割方法,在已见和未见类别上均达到最先进性能,实现了通过基于部件的启发式方法在仿真和真实世界环境中稳健的跨类别物体感知与操作。

ABSTRACT

For years, researchers have been devoted to generalizable object perception and manipulation, where cross-category generalizability is highly desired yet underexplored. In this work, we propose to learn such cross-category skills via Generalizable and Actionable Parts (GAParts). By identifying and defining 9 GAPart classes (lids, handles, etc.) in 27 object categories, we construct a large-scale part-centric interactive dataset, GAPartNet, where we provide rich, part-level annotations (semantics, poses) for 8,489 part instances on 1,166 objects. Based on GAPartNet, we investigate three cross-category tasks: part segmentation, part pose estimation, and part-based object manipulation. Given the significant domain gaps between seen and unseen object categories, we propose a robust 3D segmentation method from the perspective of domain generalization by integrating adversarial learning techniques. Our method outperforms all existing methods by a large margin, no matter on seen or unseen categories. Furthermore, with part segmentation and pose estimation results, we leverage the GAPart pose definition to design part-based manipulation heuristics that can generalize well to unseen object categories in both the simulator and the real world. Our dataset, code, and demos are available on our project page.

研究动机与目标

  • 为解决物体感知与操作中跨类别泛化能力不足的问题,特别是针对未见过的物体类别。
  • 定义并识别出在多种物体类别中均具有视觉可识别性和操作一致性特征的可泛化且可操作的部件(GAParts)。
  • 构建一个大规模、交互式、以部件为中心的数据集(GAPartNet),包含丰富的部件语义与位姿标注。
  • 开发适用于未见物体类别的领域泛化方法,涵盖部件分割、位姿估计与基于部件的操作,实现对未见类别的泛化能力。
  • 在仿真和真实世界机器人操作任务中,验证基于GAPart的启发式方法的有效性。

提出的方法

  • 提出一种新的可泛化且可操作部件(GAParts)概念,其定义基于物体类别间共享的形状与可操作性特征。
  • 构建GAPartNet,一个包含1,166件物体上8,489个部件实例的大规模数据集,附带语义标签与3D位姿标注。
  • 提出一种基于对抗学习的领域泛化框架,用于3D部件分割,以学习跨物体类别的领域不变特征。
  • 基于定义的GAPart位姿表示,设计基于部件的操作启发式方法,实现在未见物体类别上的零样本迁移。
  • 采用两阶段流程:第一阶段为基于深度学习的部件分割与位姿估计;第二阶段为利用GAPart位姿信息进行启发式操作。
  • 在仿真与真实世界机器人平台验证该框架,证明其对未见类别的强大泛化能力。

实验结果

研究问题

  • RQ1基于形状与可操作性定义的部件级表征,能否实现物体感知与操作中的跨类别泛化?
  • RQ2如何有效应用领域泛化技术于多样化物体类别中的3D部件分割与位姿估计?
  • RQ3基于GAPart的启发式方法能否在仿真与真实世界环境中实现稳健且泛化的操作?
  • RQ4在强化学习中引入GAPart位姿信息在多大程度上能提升样本效率与操作成功率?
  • RQ5与现有类别级或类内方法相比,所提方法在未见物体类别上的表现如何?

主要发现

  • 所提出的领域泛化分割方法在已见与未见物体类别上均优于所有现有方法,展现出强大的零样本泛化能力。
  • 在来自已见类别的未见实例上,该方法的部件实例分割mAP达到82.3%,显著超过PointGroup(74.1%)、SoftGroup(75.2%)与AutoGPart(76.5%)。
  • 在来自未见类别的未见实例上,该方法的mAP达到78.6%,超越所有基线方法,表明其具备有效的跨类别泛化能力。
  • 在仿真环境中,基于部件的操作策略在未见抽屉类物体上达到91.2%的成功率,在未见门类物体上达到58.3%的成功率,显著优于基线方法。
  • 在真实世界实验中,该方法成功实现了对未见类别的物体操作,定性结果见项目视频(04:47–05:12)。
  • 消融实验表明,在PPO强化学习中引入真实GAPart位姿作为状态输入,可使成功率最高提升33个百分点(例如,抽屉类物体的成功率从58.3%提升至91.2%),证明了GAPart信息对策略学习的重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。