Skip to main content
QUICK REVIEW

[论文解读] Self-supervised 6D Object Pose Estimation for Robot Manipulation

Xinke Deng, Xiang Yu|arXiv (Cornell University)|Sep 23, 2019
Robot Manipulation and Learning参考文献 40被引用 14
一句话总结

本文提出了一种用于机器人操作的自监督6D物体位姿估计系统,通过主动视觉和机器人交互生成用于微调神经网络的准确真实世界位姿标注数据。通过利用RGB-D相机反馈和机器人引起的场景变化,该系统提升了分割和位姿估计的准确性,将抓取成功率从46.7%提高至86.7%,并将初始化时间减少了55.3%,相比仅使用合成数据训练的方法。

ABSTRACT

To teach robots skills, it is crucial to obtain data with supervision. Since annotating real world data is time-consuming and expensive, enabling robots to learn in a self-supervised way is important. In this work, we introduce a robot system for self-supervised 6D object pose estimation. Starting from modules trained in simulation, our system is able to label real world images with accurate 6D object poses for self-supervised learning. In addition, the robot interacts with objects in the environment to change the object configuration by grasping or pushing objects. In this way, our system is able to continuously collect data and improve its pose estimation modules. We show that the self-supervised learning improves object segmentation and 6D pose estimation performance, and consequently enables the system to grasp objects more reliably. A video showing the experiments can be found at https://youtu.be/W1Y0Mmh1Gd8.

研究动机与目标

  • 解决6D物体位姿估计中合成数据与真实世界数据之间的域差距问题。
  • 通过抓取和推动等机器人交互,实现实时、自监督的数据持续采集。
  • 通过自标注的真实世界数据,提升6D物体位姿估计和语义分割的准确性。
  • 通过微调后的位姿估计网络,增强基于模型的抓取性能。
  • 通过迭代式主动数据采集,实现机器人系统的终身学习。

提出的方法

  • 将RGB-D相机安装在机器人操作臂上,捕获工作空间内物体的多视角图像。
  • 利用基于正向运动学的运动先验,通过粒子滤波初始化6D物体位姿,实现在多视角间准确跟踪。
  • 系统采用自监督循环:在位姿跟踪后,机器人通过抓取或推动物体生成新场景和新数据。
  • 使用自标注的真实图像微调预训练的神经网络,用于语义分割和6D位姿估计。
  • 在初始估计后,应用基于SDF的位姿优化,以提高平移和旋转的准确性。
  • 系统采用在RGB图像上训练的自编码器,以重建物体形状并优化位姿预测。
Figure 1: Our self-supervised learning process for robot manipulation.
Figure 1: Our self-supervised learning process for robot manipulation.

实验结果

研究问题

  • RQ1机器人系统能否在无人工监督的情况下,自动为真实世界图像生成准确的6D位姿标注?
  • RQ2通过机器人交互收集的真实世界数据进行自监督微调,如何提升6D位姿估计和分割性能?
  • RQ3通过抓取或推动实现的主动场景重配置,在多大程度上提升了数据多样性并增强了模型泛化能力?
  • RQ4自监督学习是否能显著提升在杂乱真实环境中的抓取成功率?
  • RQ5在粒子滤波中使用RGB仅数据与RGB-D数据,对位姿估计有何影响?

主要发现

  • 使用自标注的真实图像对语义分割网络进行微调,显著提升了分割准确性,尤其在具有复杂材质(如高光)的物体上表现更优。
  • 对自编码器进行自监督微调后,重建质量得到提升,从而进一步提高了6D位姿估计的准确性。
  • 当使用真实数据进行微调时,系统抓取成功率达到86.7%,相比仅使用合成数据训练,提升了85.7个百分点。
  • 平均物体初始化时间减少了55.3%(从10.04秒降至4.48秒),经自监督微调后。
  • 由于更快更准确的位姿初始化,单次抓取尝试的总时间减少了27.3%(从21.27秒降至15.47秒)。
  • 出人意料的是,仅使用RGB的粒子滤波配合SDF优化,表现优于RGB-D版本,因为自编码器仅在RGB数据上训练,从而实现了更精确的旋转估计。
Figure 2: Overview of our self-supervised 6D object pose estimation system.
Figure 2: Overview of our self-supervised 6D object pose estimation system.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。