Skip to main content
QUICK REVIEW

[论文解读] Domain Transfer for 3D Pose Estimation from Color Images without Manual Annotations

Mahdi Rad, Markus Oberweger|arXiv (Cornell University)|Jan 1, 2018
Human Pose and Action Recognition参考文献 50被引用 51
一句话总结

本文提出一种方法,通过学习颜色到深度的特征映射并使用配对的 RGB-D 数据,将颜色图像中的信息用于估计 3D 姿态,同时用最大均值差异 (MMD) 将真实和合成深度域对齐。这种方法适用于 3D 物体姿态估计和 3D 手势姿态估计。

ABSTRACT

We introduce a novel learning method for 3D pose estimation from color images. While acquiring annotations for color images is a difficult task, our approach circumvents this problem by learning a mapping from paired color and depth images captured with an RGB-D camera. We jointly learn the pose from synthetic depth images that are easy to generate, and learn to align these synthetic depth images with the real depth images. We show our approach for the task of 3D hand pose estimation and 3D object pose estimation, both from color images only. Our method achieves performances comparable to state-of-the-art methods on popular benchmark datasets, without requiring any annotations for the color images.

研究动机与目标

  • 激发在无需繁重的颜色图像标注的情况下,对颜色图像进行 3D 姿态估计的研究。
  • 利用带标记的深度图像(真实或合成)来训练一个鲁棒的姿态估计器。
  • 在没有目标域标注的情况下,弥合颜色模态与深度模态之间的域差距。

提出的方法

  • 在合成深度数据上训练深度特征提取器 f_D 和姿态估计器 h_D。
  • 使用 RGB-D 对和特征映射损失 L_FM,训练颜色特征提取器 f_C 和映射网络 g,将颜色特征映射到深度特征。
  • 在再生核希尔伯特空间 RKHS 中,使用最大均值差异(MMD)对齐真实与合成深度特征分布。
  • 在一个联合目标中结合合成深度数据的姿态损失、特征映射损失和 MMD 损失(权重为 beta 和 gamma)。
  • 推理阶段通过 g∘f_C 将颜色特征映射到深度特征空间,并应用 h_D 以从颜色图像估计 3D 姿态。

实验结果

研究问题

  • RQ1是否可在不使用任何颜色标注的前提下,通过利用配对的 RGB-D 数据和只深度监督来从颜色图像估计 3D 姿态?
  • RQ2学习得到的颜色到深度特征映射在将姿态知识从合成深度数据迁移到真实颜色图像方面有多有效?
  • RQ3基于 MMD 的真实与合成深度特征的域对齐是否足以在没有真实颜色标注的情况下弥合域间差距?
  • RQ4该方法是否同时适用于颜色图像的刚性物体姿态估计和 3D 手势姿态估计?

主要发现

  • 在 LINEMOD 及 STB/RHD 基准测试上,在没有标注颜色图像的情况下,姿态估计性能达到与最先进方法相当的水平。
  • 在 LINEMOD 上,超越需要颜色标注的方法,接近最优的需要标注的方法的性能。
  • 对于 3D 手势姿态,在 STB 上给出具竞争力的结果,准确度与基于标注的方法相当,使用 RGB-D 对进行学习。
  • 推理时间较短:在 TITAN X 平台上,物体姿态约 3.2 ms,手势姿态约 8.6 ms。
  • 训练需要合成深度数据和 RGB-D 对,预训练步骤可提高收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。