Skip to main content
QUICK REVIEW

[论文解读] SMAP: Single-Shot Multi-Person Absolute 3D Pose Estimation

Jianan Zhen, Qi Fang|arXiv (Cornell University)|Aug 26, 2020
Human Pose and Action Recognition参考文献 44被引用 5
一句话总结

SMAP 提出了一种单阶段、自底向上的多人群体绝对3D姿态估计框架,通过新颖的根深度图与深度感知的部件关联,建模人与人之间的深度关系,从而提升2D和3D姿态估计的准确性。该方法在 CMU Panoptic 和 MuPoTS-3D 数据集上达到最先进性能,并在真实场景视频中展现出更强的鲁棒性,尤其在遮挡和尺度模糊情况下表现更优。

ABSTRACT

Recovering multi-person 3D poses with absolute scales from a single RGB image is a challenging problem due to the inherent depth and scale ambiguity from a single view. Addressing this ambiguity requires to aggregate various cues over the entire image, such as body sizes, scene layouts, and inter-person relationships. However, most previous methods adopt a top-down scheme that first performs 2D pose detection and then regresses the 3D pose and scale for each detected person individually, ignoring global contextual cues. In this paper, we propose a novel system that first regresses a set of 2.5D representations of body parts and then reconstructs the 3D absolute poses based on these 2.5D representations with a depth-aware part association algorithm. Such a single-shot bottom-up scheme allows the system to better learn and reason about the inter-person depth relationship, improving both 3D and 2D pose estimation. The experiments demonstrate that the proposed approach achieves the state-of-the-art performance on the CMU Panoptic and MuPoTS-3D datasets and is applicable to in-the-wild videos.

研究动机与目标

  • 为解决从单张 RGB 图像中估计多人绝对3D姿态的挑战,其中深度与尺度模糊会阻碍准确重建。
  • 克服自顶向下方法忽略全局上下文的局限,提出一种自底向上的方法,聚合图像范围内的线索(如身体尺寸、场景布局和人与人之间的关系)。
  • 通过显式建模人与人之间的深度关系,提升3D姿态估计性能,尤其是在遮挡或重叠场景下。
  • 开发统一的单次前向传播框架,联合回归2D关键点热力图、部件亲和力场、相对深度图与根深度图,以提升3D姿态的一致性。

提出的方法

  • 该方法使用全卷积神经网络回归根深度图,直接从输入图像预测每个个体根关节的深度,以3D姿态标注作为监督信号。
  • 联合预测2D关键点热力图与部件亲和力场(PAFs),以自底向上的方式定位并关联个体间的身体部件。
  • 提出一种新型的部件相对深度图,用于编码每个身体部件中两个关节之间的相对深度,从而在部件关联过程中实现深度感知推理。
  • 深度感知的部件关联算法利用预测的深度信息解决遮挡问题,并施加合理的骨骼长度约束,提升关键点分组的准确性。
  • 通过结合2D关键点关联结果、预测的根深度与相对深度图,重建最终的3D姿态,确保绝对3D位置的一致性。
  • 整个流程以端到端方式训练,使模型能够全局学习与深度相关的线索。

实验结果

研究问题

  • RQ1单阶段、自底向上的框架是否能有效利用全局图像上下文与深度线索,实现多人绝对3D姿态的准确估计?
  • RQ2直接从图像中预测身体深度相比事后回归深度,如何提升3D姿态估计与部件关联的性能?
  • RQ3深度感知的部件关联在重叠或遮挡的人体中,能在多大程度上减少错误?
  • RQ4所提方法是否能泛化到真实场景视频,并在 CMU Panoptic 与 MuPoTS-3D 等基准数据集上达到最先进性能?
  • RQ5根深度与相对深度监督对整体3D姿态估计精度的贡献如何?

主要发现

  • SMAP 在 CMU Panoptic 数据集上达到最先进性能,Human3.6M 数据集上 PCK@0.2 绝对精度达 89.2%,平均 MPJPE 为 54.1 mm。
  • 在 MuPoTS-3D 数据集上,SMAP 的 PCK rel 得分为 80.5%,PCK abs 得分为 38.7%,在序列级与匹配真实值评估中均优于先前方法。
  • 消融实验表明,加入根深度监督后,PCK root 从 29.9%(仅2D)提升至 45.5%,证明了深度监督的价值。
  • 深度感知的部件关联算法通过利用深度预测结果解决歧义,显著降低了遮挡场景下的关键点关联错误。
  • 完整模型(包含根深度、相对深度与2D分支)在 MuPoTS-3D 数据集上达到 92.3% 的召回率,显著优于仅根深度的变体(85.0% 召回率)。
  • SMAP 在真实场景视频中表现出良好的泛化能力,如在复杂、无约束场景中多人重叠与遮挡的定性结果所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。