Skip to main content
QUICK REVIEW

[论文解读] Unseen Object 6D Pose Estimation: A Benchmark and Baselines

Minghao Gou, Haolin Pan|arXiv (Cornell University)|Jun 23, 2022
Robot Manipulation and Learning被引用 9
一句话总结

本文提出了一种针对未见物体6D姿态估计的新基准和基线,其中模型必须仅使用物体的网格模型,在无需微调的情况下预测新物体的6D姿态。该方法提出一种两阶段方法:首先通过端到端的3D对应网络检测新物体与部分RGBD场景之间的密集对应关系,随后进行鲁棒的姿态估计;该方法在使用新型IADD指标的不同测试子集上,相较于基线分别实现了20.3、14.9和9.7的AUC提升,该指标对姿态模糊性具有不变性。

ABSTRACT

Estimating the 6D pose for unseen objects is in great demand for many real-world applications. However, current state-of-the-art pose estimation methods can only handle objects that are previously trained. In this paper, we propose a new task that enables and facilitates algorithms to estimate the 6D pose estimation of novel objects during testing. We collect a dataset with both real and synthetic images and up to 48 unseen objects in the test set. In the mean while, we propose a new metric named Infimum ADD (IADD) which is an invariant measurement for objects with different types of pose ambiguity. A two-stage baseline solution for this task is also provided. By training an end-to-end 3D correspondences network, our method finds corresponding points between an unseen object and a partial view RGBD image accurately and efficiently. It then calculates the 6D pose from the correspondences using an algorithm robust to object symmetry. Extensive experiments show that our method outperforms several intuitive baselines and thus verify its effectiveness. All the data, code and models will be made publicly available. Project page: www.graspnet.net/unseen6d

研究动机与目标

  • 为训练期间未见过的新物体实现6D姿态估计,解决当前方法需为每个新物体重新训练的局限性。
  • 构建一个包含真实世界测试场景和合成数据的现实基准,包含48个未见物体,以标准化该新兴任务的评估。
  • 提出一种新型评估指标——最小ADD(IADD),该指标对姿态模糊性具有不变性,可实现对具有不同对称性物体的公平比较。
  • 提供公开的数据集、代码和模型,以加速零样本6D姿态估计领域的研究。

提出的方法

  • 提出一种两阶段框架:首先,3D对应检测网络将新物体的网格模型和部分RGBD场景点云作为输入,预测密集的3D对应点。
  • 网络通过多任务损失端到端训练,联合实现物体分割与物体和场景之间对应点的预测。
  • 第二阶段使用一种鲁棒算法(受EPOS启发)从检测到的3D对应点中计算6D姿态,有效处理物体对称性问题。
  • 该方法在空间点网络(SPN)中引入可学习注意力机制,提升在噪声和部分观测条件下的对应匹配性能。
  • 所提出的IADD指标计算所有对称姿态下可能的最小ADD误差,提供一致且不变的评估基线。
  • 该基准基于现有数据集构建,包含1000多个训练物体、1500个训练场景,以及90个包含48个未见物体的真实世界测试场景。

实验结果

研究问题

  • RQ1在仅提供物体网格模型而无需微调的情况下,深度学习模型能否泛化以估计未见物体的6D姿态?
  • RQ2如何设计一种统一且鲁棒的评估指标,以公平评估在具有不同姿态模糊程度物体上的6D姿态估计性能?
  • RQ3端到端学习的对应网络与传统方法(如FCGF、SuperGlue)在未见物体6D姿态估计中的性能差距如何?
  • RQ4所提出的SPN模块在真实世界场景中噪声和部分观测条件下的对应检测中起到何种改进作用?
  • RQ5所提方法在未见物体姿态估计任务中的准确率和推理效率方面,相较于直观基线方法的性能优势有多大?

主要发现

  • 该方法在三个具有不同物体类型的独立测试子集上,相较于调优后的基线,分别实现了20.3、14.9和9.7的AUC提升,证明了其强大的泛化能力。
  • 在YCB-Video基准上,该方法在未微调的情况下相比实现的基线实现了11.2的AUC提升,证实了其零样本泛化能力。
  • IADD指标相比ADD-S更具数值稳定性,因为它避免了对对称物体的性能高估。
  • 消融实验表明,若移除SPN模块,性能显著下降,证明其在准确对应学习中的关键作用。
  • 该方法在单张RTX 3070 GPU上推理时间约为4秒,优于FCGF+SPN(约3秒)和SuperGlue+RANSAC(约15秒),在准确率和速度上均表现更优。
  • 定性结果表明,该方法在小物体或对称物体上比FCGF+SPN和SuperGlue+RANSAC更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。