Skip to main content
QUICK REVIEW

[论文解读] Sim-to-Real 6D Object Pose Estimation via Iterative Self-training for Robotic Bin Picking

Kai Chen, Rui Cao|arXiv (Cornell University)|Apr 14, 2022
Robot Manipulation and Learning被引用 4
一句话总结

本文提出了一种用于机器人料箱抓取中从仿真到现实的6D物体位姿估计的迭代自训练框架,利用照片级真实感仿真器生成合成数据,并通过教师模型生成的伪标签在真实数据上迭代优化位姿估计。该方法在新数据集上将ADD(-S)指标提升了22.62%,并将机器人料箱抓取成功率提高了19.54%,展示了无需人工标注即可实现有效域自适应的能力。

ABSTRACT

In this paper, we propose an iterative self-training framework for sim-to-real 6D object pose estimation to facilitate cost-effective robotic grasping. Given a bin-picking scenario, we establish a photo-realistic simulator to synthesize abundant virtual data, and use this to train an initial pose estimation network. This network then takes the role of a teacher model, which generates pose predictions for unlabeled real data. With these predictions, we further design a comprehensive adaptive selection scheme to distinguish reliable results, and leverage them as pseudo labels to update a student model for pose estimation on real data. To continuously improve the quality of pseudo labels, we iterate the above steps by taking the trained student model as a new teacher and re-label real data using the refined teacher model. We evaluate our method on a public benchmark and our newly-released dataset, achieving an ADD(-S) improvement of 11.49% and 22.62% respectively. Our method is also able to improve robotic bin-picking success by 19.54%, demonstrating the potential of iterative sim-to-real solutions for robotic applications.

研究动机与目标

  • 为解决机器人料箱抓取应用中真实世界6D物体位姿数据标注成本高且难度大的问题。
  • 在无需定制仿真设置或网络架构的情况下,减少6D物体位姿估计中的仿真到现实域差距。
  • 仅使用未标注的真实数据,实现位姿估计模型在新真实世界料箱抓取场景中的可扩展、与网络无关的适应。
  • 通过使用伪标签进行迭代自训练,提升仅在合成数据上训练的位姿估计模型在真实世界中的性能。

提出的方法

  • 使用照片级真实感仿真器生成丰富的合成RGB-D数据,并附带精确的6D位姿标注,用于预训练初始位姿估计网络。
  • 预训练模型作为教师模型,对未标注的真实世界数据预测6D位姿,生成用于自训练的伪标签。
  • 采用综合的自适应选择策略,结合2D外观特征与3D几何线索,识别可靠的伪标签并过滤掉噪声预测。
  • 在选定的伪标签真实数据上微调学生模型,随后将更新后的学生模型作为新教师模型,重复该过程。
  • 迭代优化过程逐步提升真实数据上的位姿估计精度,性能在约5轮迭代后趋于饱和。
  • 该方法在公开基准和新发布的数据集上进行了评估,并部署于真实机械臂上完成料箱抓取任务。

实验结果

研究问题

  • RQ1在无需人工标注的情况下,使用伪标签进行迭代自训练是否能有效弥合6D物体位姿估计中的仿真到现实域差距?
  • RQ2随着在真实数据上自训练轮次的增加,位姿估计模型的性能如何变化?
  • RQ3该方法在不同主干网络和真实世界料箱抓取场景中的泛化能力如何?
  • RQ4通过提升位姿估计精度,该方法是否能显著提高机器人料箱抓取的成功率?

主要发现

  • 所提方法在公开的ROBI基准数据集上实现了ADD(-S)指标11.49%的提升。
  • 在新发布的数据集上,该方法将ADD(-S)提升了22.62%,展现出强大的域自适应能力。
  • 应用自训练框架后,机器人料箱抓取成功率从67.96%提升至87.50%。
  • 首次迭代带来的性能增益最大,约五轮迭代后收益逐渐减少。
  • 该方法在不同主干网络(如DenseFusion)上均具有泛化能力,且在真实数据上表现出一致的性能提升。
  • 定性结果表明,迭代优化使位姿预测结果随时间逐步视觉收敛至真实值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。