Skip to main content
QUICK REVIEW

[论文解读] PoseLifter: Absolute 3D human pose lifting network from a single noisy 2D human pose

Ju Yong Chang, Gyeongsik Moon|arXiv (Cornell University)|Oct 26, 2019
Human Pose and Action Recognition被引用 9
一句话总结

PoseLifter 是一种新颖的深度学习网络,通过联合估计根关节的绝对深度和相对于根关节的3D姿态,利用归一化的2D姿态、2D位置和2D尺度,将单个嘈杂的2D人体姿态提升为相机坐标系中的绝对3D姿态。通过在训练中引入真实的2D姿态误差,并使用规范深度归一化来解决焦距模糊性,该方法在2D到3D姿态提升和3D人体姿态估计任务中达到了最先进性能。

ABSTRACT

This study presents a new network (i.e., PoseLifter) that can lift a 2D human pose to an absolute 3D pose in a camera coordinate system. The proposed network estimates the absolute 3D location of a target subject and generates an improved 3D relative pose estimation compared with existing pose-lifting methods. Using the PoseLifter with a 2D pose estimator in a cascade fashion can estimate a 3D human pose from a single RGB image. In this case, we empirically prove that using realistic 2D poses synthesized with the real error distribution of 2D body joints considerably improves the performance of our PoseLifter. The proposed method is applied to public datasets to achieve state-of-the-art 2D-to-3D pose lifting and 3D human pose estimation.

研究动机与目标

  • 为解决现有方法仅生成相对3D姿态而无法在相机坐标系中实现绝对3D姿态提升的病态问题,即从2D人体姿态提升为相机坐标系中的绝对3D姿态。
  • 通过将2D姿态估计器与一种新型3D姿态提升网络结合,提升从单张RGB图像进行3D人体姿态估计的性能。
  • 解决单图像2D到3D姿态提升中因主体尺寸和相机焦距未知而导致的绝对深度估计模糊性问题。
  • 通过在反映真实2D姿态估计器误差分布的合成2D姿态上进行训练,提升3D姿态提升网络的泛化能力与性能。
  • 通过结合目标检测与PoseLifter的级联流程,实现在非受限、真实场景环境中的鲁棒3D姿态估计。

提出的方法

  • PoseLifter 联合估计根关节的绝对3D坐标与相对于根关节的3D姿态,输入包括:归一化的2D姿态、2D关节点位置和2D尺度。
  • 网络采用通过焦距归一化的规范深度表示,以解决因焦距未知和主体尺寸未知导致的绝对深度估计模糊性。
  • 利用2D位置和尺度信息提升对根关节相对3D姿态的估计,减少透视投影带来的模糊性。
  • 通过使用反映真实世界2D姿态估计器误差分布的合成2D姿态进行训练,使模型更好地泛化到真实2D姿态估计输出。
  • 采用级联流水线,将预训练的2D姿态估计器(如COCO或MPII中的模型)与PoseLifter结合,实现从单张RGB图像端到端的3D人体姿态估计。
  • 网络架构设计为在一次前向传播中同时回归绝对根深度(通过规范深度)和相对3D姿态。

实验结果

研究问题

  • RQ1深度学习模型能否将2D人体姿态提升为相机坐标系中的绝对3D姿态,而非仅生成相对3D姿态?
  • RQ2当仅提供单张2D图像时,如何缓解绝对深度估计的病态问题?
  • RQ3使用具有真实误差分布的合成2D姿态是否能提升3D姿态提升网络的泛化能力与性能?
  • RQ4规范深度表示能否有效解决真实世界数据集中因焦距变化导致的模糊性问题?
  • RQ5所提出的PoseLifter能否在非受限环境中实现从单张RGB图像进行3D人体姿态估计的最先进性能?

主要发现

  • 在Human3.6M数据集上,PoseLifter 的3D PCK得分为81.6%,优于以往最先进方法。
  • 在MPI-INF-3DHP数据集上,该方法实现了83.9%的3D PCK得分和217.4 mm的MRPE,超越所有现有方法。
  • 消融实验表明,若移除规范深度表示,MPI-INF-3DHP数据集上的MRPE将上升至296.9 mm,证明其在缓解焦距模糊性方面具有关键作用。
  • 通过使用反映真实噪声分布的合成2D姿态进行训练,性能显著提升,表现为MRPE明显下降,验证了真实误差分布的重要性。
  • 该方法在COCO数据集的野外图像上表现出良好的泛化能力,即使在存在遮挡和视角多变的复杂场景中,也能成功估计3D姿态。
  • 定性结果表明,该方法在包括演播室、户外及非受限环境在内的多种姿态与场景中,均能生成准确且合理的3D姿态估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。