[论文解读] OMAD: Object Model with Articulated Deformations for Pose Estimation and Retrieval
本文提出OMAD,一种类别特定的参数化模型,通过形状参数和关节状态显式表示刚性物体,以捕捉几何形变和位姿形变。OMADNet是一种深度学习流水线,从单视角观测中预测这些参数,在新构建的合成数据集上实现了类别级位姿估计的最先进性能,以及82.3%的mAP(平均平均精度)在可动物体检索任务中。
Articulated objects are pervasive in daily life. However, due to the intrinsic high-DoF structure, the joint states of the articulated objects are hard to be estimated. To model articulated objects, two kinds of shape deformations namely the geometric and the pose deformation should be considered. In this work, we present a novel category-specific parametric representation called Object Model with Articulated Deformations (OMAD) to explicitly model the articulated objects. In OMAD, a category is associated with a linear shape function with shared shape basis and a non-linear joint function. Both functions can be learned from a large-scale object model dataset and fixed as category-specific priors. Then we propose an OMADNet to predict the shape parameters and the joint states from an object's single observation. With the full representation of the object shape and joint states, we can address several tasks including category-level object pose estimation and the articulated object retrieval. To evaluate these tasks, we create a synthetic dataset based on PartNet-Mobility. Extensive experiments show that our simple OMADNet can serve as a strong baseline for both tasks.
研究动机与目标
- 为解决从单视角观测(如深度图像或点云)建模高自由度可动物体的挑战。
- 在统一的、类别特定的表示中显式建模几何形变和位姿形变。
- 开发一种深度学习框架,预测用于下游任务(如位姿估计和检索)的形状参数和关节状态。
- 构建一个大规模合成数据集,用于在多样化位姿和遮挡条件下评估可动物体建模。
- 通过统一的参数化物体模型,建立类别级位姿估计与检索的强基线。
提出的方法
- OMAD使用形状参数β和关节状态θ表示可动物体,通过从线性形状函数和非线性关节函数导出的规范空间表示P′和Φ′。
- 形状函数P′ = S(β; B)利用类别特定的形状基B来建模几何形变,而关节函数Φ′ = J(β; Γ)则利用类别特定的参数Γ来建模关节构型。
- 形变函数W(P′, Φ′, θ)将规范结构映射到相机空间,实现仅凭β和θ的完整3D重建。
- OMADNet使用具有粗略预测阶段和优化精炼阶段的神经网络,从单个观测中回归β和θ。
- 在关键点预测分支中集成注意力机制,以提高定位精度和语义一致性。
- 该方法利用从PartNet-Mobility构建的合成数据集ArtImage,用于在位姿估计和检索任务上进行模型训练与评估。
实验结果
研究问题
- RQ1统一的参数化表示能否在类别级别有效建模可动物体中的几何形变与位姿形变?
- RQ2深度神经网络能否从单视角观测中高精度地预测形状参数和关节状态?
- RQ3预测的形状参数是否可作为可动物体检索中鲁棒且与位姿无关的特征签名?
- RQ4所提出的OMAD表示在类别级位姿估计与检索中与现有方法相比表现如何?
- RQ5关键点监督和注意力机制对OMADNet流水线性能的影响是什么?
主要发现
- 在笔记本电脑类别上,OMADNet实现1.1°的关节状态误差和0.01的关节距离误差,显著优于基线方法。
- 在眼镜类别上,该方法对两个关节分别实现1.1°和1.2°的关节状态误差,展示了在复杂形变下的高精度。
- 在五个类别的可动物体检索任务中,该方法实现82.3%的平均mAP,优于Siamese网络基线。
- 消融研究显示,在优化过程中使用真实关键点可将抽屉类别的关节状态误差降低至0.001°,表明关键点预测是当前瓶颈。
- t-SNE可视化结果表明,预测的形状参数在不同实例间具有位姿不变性且分布良好分离,验证了其作为检索特征签名的有效性。
- 在关键点分支中集成注意力分数可提升所有指标的性能,凸显其在增强定位精度方面的作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。