Skip to main content
QUICK REVIEW

[论文解读] Generative Category-Level Shape and Pose Estimation with Semantic Primitives

Guanglin Li, Yifeng Li|arXiv (Cornell University)|Oct 3, 2022
Human Pose and Action Recognition被引用 10
一句话总结

该论文提出了一种基于语义基元的生成式类别级形状与位姿估计框架,通过使用语义基元建模类别内形状变化,并引入一种新型的SIM(3)不变描述符以解耦形状与位姿优化。通过在任意位姿下迭代优化潜在形状,该方法在真实世界基准上实现了最先进性能,即使仅使用合成数据进行训练。

ABSTRACT

Empowering autonomous agents with 3D understanding for daily objects is a grand challenge in robotics applications. When exploring in an unknown environment, existing methods for object pose estimation are still not satisfactory due to the diversity of object shapes. In this paper, we propose a novel framework for category-level object shape and pose estimation from a single RGB-D image. To handle the intra-category variation, we adopt a semantic primitive representation that encodes diverse shapes into a unified latent space, which is the key to establish reliable correspondences between observed point clouds and estimated shapes. Then, by using a SIM(3)-invariant shape descriptor, we gracefully decouple the shape and pose of an object, thus supporting latent shape optimization of target objects in arbitrary poses. Extensive experiments show that the proposed method achieves SOTA pose estimation performance and better generalization in the real-world dataset. Code and video are available at https://zju3dv.github.io/gCasp.

研究动机与目标

  • 解决类别级3D物体位姿估计中大规模类别内形状变化的挑战。
  • 通过解耦形状与位姿估计,提升鲁棒性与优化灵活性。
  • 通过一种新型几何描述符实现在任意位姿下的在线、迭代形状优化。
  • 仅使用合成训练数据即可实现对真实世界场景的强大泛化能力。

提出的方法

  • 使用语义基元(例如圆柱形主体、手柄状部件)表示物体形状,以在共享潜在空间中统一多样化形状。
  • 采用具有两个自编码解码器的生成模型:一个用于细节,一个用于语义基元,共享同一潜在代码。
  • 提出一种基于语义基元几何分布的SIM(3)-不变形状描述符,以实现形状与位姿的解耦。
  • 通过最小化观测点云与生成点云之间的Chamfer距离,利用该描述符实现在线潜在形状优化。
  • 通过基于对应关系的算法恢复最终物体位姿,将优化后形状的语义基元与观测到的基元对齐。
  • 使用部件分割网络为输入点云部件分配语义标签,以支持基于基元的对应关系建立。

实验结果

研究问题

  • RQ1语义基元能否有效统一类别内多样化形状,以实现类别级形状估计?
  • RQ2SIM(3)-不变描述符能否在任意位姿下实现形状与位姿优化的可靠解耦?
  • RQ3与单次预测相比,迭代潜在形状优化是否能提升位姿估计精度?
  • RQ4当仅使用合成数据训练时,该方法能否泛化到真实世界数据?

主要发现

  • 所提方法在REAL275真实世界基准上实现了最先进类别级位姿估计性能。
  • REAL275上的形状重建误差降低至3.46×10⁻³(Chamfer距离),优于SGPA在平均形状情况下的2.44×10⁻³。
  • 使用优化形状时,位姿估计精度显著提升(例如REAL275上mAP达88.4%),相比平均形状或随机形状表现更优。
  • 当语义基元数量从64增加到256时,位姿精度提升,达到256后因分割噪声在512时开始下降。
  • 使用10⁶个原子描述符的形状描述符可实现最低重建误差(RANSAC下为3.44×10⁻³),表明对描述符选择具有鲁棒性。
  • 该方法在真实世界数据上泛化良好,无需真实世界微调即可实现最先进结果,展现出强大的零样本泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。