Skip to main content
QUICK REVIEW

[论文解读] Learning Canonical Shape Space for Category-Level 6D Object Pose and Size Estimation

Dengsheng Chen, Jun Li|arXiv (Cornell University)|Jan 25, 2020
3D Shape Modeling and Analysis参考文献 26被引用 9
一句话总结

本文提出了一种无需对应关系的类别级6D物体位姿与尺寸估计方法,通过变分自编码器(VAE)在多样化3D形状上训练,学习一个规范形状空间(CASS)。该方法将RGBD图像嵌入到CASS中的视图分解、位姿无关的形状表征,并通过与位姿相关特征的对比匹配来估计位姿,在基准数据集上实现了最先进精度,且无需使用CAD模型。

ABSTRACT

We present a novel approach to category-level 6D object pose and size estimation. To tackle intra-class shape variations, we learn canonical shape space (CASS), a unified representation for a large variety of instances of a certain object category. In particular, CASS is modeled as the latent space of a deep generative model of canonical 3D shapes with normalized pose. We train a variational auto-encoder (VAE) for generating 3D point clouds in the canonical space from an RGBD image. The VAE is trained in a cross-category fashion, exploiting the publicly available large 3D shape repositories. Since the 3D point cloud is generated in normalized pose (with actual size), the encoder of the VAE learns view-factorized RGBD embedding. It maps an RGBD image in arbitrary view into a pose-independent 3D shape representation. Object pose is then estimated via contrasting it with a pose-dependent feature of the input RGBD extracted with a separate deep neural networks. We integrate the learning of CASS and pose and size estimation into an end-to-end trainable network, achieving the state-of-the-art performance.

研究动机与目标

  • 解决类别级6D物体位姿估计中因类内形状差异带来的挑战,尤其在未见实例无CAD模型的情况下。
  • 构建一种统一且可泛化的形状表征,以捕捉类别内部的多样化形状变化。
  • 实现仅从单视角RGBD图像中准确估计6D位姿与尺寸,且不依赖密集对应关系或真实CAD模型。
  • 通过重建度量尺寸的3D形状,实现位姿与尺寸估计的解耦,降低学习复杂度。
  • 设计一个端到端可训练的框架,联合学习规范形状空间与位姿/尺寸估计,提升泛化能力。

提出的方法

  • 在大规模跨类别3D形状集合上训练VAE,以学习具有归一化位姿与度量尺寸的潜在规范形状空间(CASS)。
  • 增强VAE编码器,使其同时接收RGBD图像与3D形状作为输入,从而在缺乏真实世界RGBD-形状配对数据的情况下,仍能利用现成的3D资源库进行训练。
  • 通过将任意视角下的输入图像映射到CASS潜在空间,学习一种视图分解、位姿无关的RGBD嵌入。
  • 使用独立的深度神经网络从输入RGBD中提取位姿相关特征,用于与CASS嵌入进行对比比较。
  • 通过权重共享与批量混合,实现位姿无关(CASS)与位姿相关特征之间的分布匹配,以稳定训练过程。
  • 将CASS学习、形状重建与位姿/尺寸估计整合为一个端到端可微分网络,实现联合优化。

实验结果

研究问题

  • RQ1所学习的规范形状空间是否能有效表征类别级6D物体位姿估计中的类内形状差异?
  • RQ2在显著形状变化下,位姿无关与位姿相关特征之间的对比匹配是否优于基于密集对应的方法?
  • RQ3基于VAE的方法能否联合学习从单视角RGBD图像中重建度量尺寸的3D形状与6D位姿估计?
  • RQ4位姿无关与位姿相关特征之间的分布匹配在提升训练稳定性和准确性方面有多有效?
  • RQ5所提出方法在无CAD模型的情况下,对未见物体实例的泛化能力如何?

主要发现

  • 完整方法在类别级位姿估计基准上达到84.2% mAP、77.7% IoU@25、23.5%(5°/5cm)与58.3%(10°/10cm)的性能,优于先前最先进方法。
  • 消融实验表明,CASS学习是最关键的组件,其移除后性能显著下降,尤其在5°/5cm与10°/10cm指标上。
  • 批量混合与分布匹配对训练稳定性与特征对齐至关重要,其移除导致准确率明显下降。
  • 将VAE替换为自编码器(AE)会降低泛化能力,表明VAE的归纳偏置有助于构建更鲁棒且多样的CASS空间。
  • 该方法可重建具有度量尺寸的完整3D点云,支持精确的尺寸估计并适用于机器人抓取任务,即使在遮挡与背景杂波条件下亦表现良好。
  • 定性结果表明,该方法在尺寸估计与形状重建方面优于NOCS,尤其在遮挡等挑战性条件下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。