[论文解读] Shape Prior Deformation for Categorical 6D Object Pose and Size Estimation
该论文提出了一种基于RGB-D图像的类别级6D物体位姿与尺寸估计的深度学习方法,通过从学习到的类别形状先验中显式建模类内形状变化,实现对物体的精确估计。该方法利用变分自编码器在潜在空间中学习类别特定的形状先验,通过预测的形变场重建完整的3D物体模型,并估计密集的2D-3D对应关系,从而实现高精度的位姿与尺寸估计,在合成数据集和真实世界基准上均达到最先进性能。
We present a novel learning approach to recover the 6D poses and sizes of unseen object instances from an RGB-D image. To handle the intra-class shape variation, we propose a deep network to reconstruct the 3D object model by explicitly modeling the deformation from a pre-learned categorical shape prior. Additionally, our network infers the dense correspondences between the depth observation of the object instance and the reconstructed 3D model to jointly estimate the 6D object pose and size. We design an autoencoder that trains on a collection of object models and compute the mean latent embedding for each category to learn the categorical shape priors. Extensive experiments on both synthetic and real-world datasets demonstrate that our approach significantly outperforms the state of the art. Our code is available at https://github.com/mentian/object-deformnet.
研究动机与目标
- 解决在无3D模型可用的情况下,对类别内未见物体实例进行6D物体位姿与尺寸估计的挑战。
- 显式建模类内形状变化,而非依赖于NOCS坐标直接回归。
- 通过从一组物体模型中学习类别形状先验,提升在多样化物体实例间的泛化能力。
- 通过统一的深度神经网络架构,联合估计密集对应关系与6D位姿。
提出的方法
- 在一组3D物体模型上训练变分自编码器,以学习每种类别的潜在嵌入。
- 计算每种类别的平均潜在嵌入,并解码生成类别形状先验,表示共享的几何特征。
- 通过深度网络从形状先验预测形变场,以重建给定实例的完整3D物体模型。
- 在观测到的深度点云与重建的3D模型之间预测密集的2D-3D对应关系。
- 使用Umeyama算法从估计的对应关系中计算6D位姿与度量尺寸。
- 对形变与对应关系预测应用正则化损失,以提升训练稳定性和泛化能力。
实验结果
研究问题
- RQ1从类别形状先验显式建模形变是否能提升对未见物体实例的6D位姿与尺寸估计性能?
- RQ2在自编码器的潜在空间中学习形状先验对类别级6D位姿估计性能有何影响?
- RQ3将形状重建与对应关系预测分离是否优于直接回归NOCS坐标?
- RQ4该方法对形状先验选择的变化(如平均嵌入、最近邻、随机采样)有多大的鲁棒性?
- RQ5对形变与对应关系预测施加正则化损失对整体性能的贡献如何?
主要发现
- 在CAMERA25合成基准上,所提方法在5°2cm阈值下的平均精度(mAP)达到93.2,优于基线方法。
- 在更具挑战性的REAL275真实世界数据集上,方法达到77.3 mAP,表明其对真实世界噪声与变化具有强大的泛化能力。
- 直接回归NOCS坐标("Regression"基线)在5°2cm阈值下的mAP显著更低(CAMERA25上低-3.1%,REAL275上低-5.6%),证实了显式形状重建的优势。
- 移除正则化损失后,REAL275上mAP在5°2cm阈值下下降5.9%,表明其在真实世界设置中对鲁棒性至关重要。
- 该方法在不同形状先验构建方式(如平均嵌入、最近邻、随机采样)下均保持稳定,其中学习到的嵌入先验表现最佳。
- 合成数据上的形状重建质量高于真实数据,表明观测噪声仍是未来工作中的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。