[论文解读] SMAP: Single-Shot Multi-Person Absolute 3D Pose Estimation
SMAP 提出了一种单阶段、自底向上的多人群体绝对3D姿态估计框架,通过新颖的根深度图与深度感知的部件关联,建模人与人之间的深度关系,从而提升2D和3D姿态估计的准确性。该方法在 CMU Panoptic 和 MuPoTS-3D 数据集上达到最先进性能,并在真实场景视频中展现出更强的鲁棒性,尤其在遮挡和尺度模糊情况下表现更优。
Recovering multi-person 3D poses with absolute scales from a single RGB image is a challenging problem due to the inherent depth and scale ambiguity from a single view. Addressing this ambiguity requires to aggregate various cues over the entire image, such as body sizes, scene layouts, and inter-person relationships. However, most previous methods adopt a top-down scheme that first performs 2D pose detection and then regresses the 3D pose and scale for each detected person individually, ignoring global contextual cues. In this paper, we propose a novel system that first regresses a set of 2.5D representations of body parts and then reconstructs the 3D absolute poses based on these 2.5D representations with a depth-aware part association algorithm. Such a single-shot bottom-up scheme allows the system to better learn and reason about the inter-person depth relationship, improving both 3D and 2D pose estimation. The experiments demonstrate that the proposed approach achieves the state-of-the-art performance on the CMU Panoptic and MuPoTS-3D datasets and is applicable to in-the-wild videos.
研究动机与目标
- 为解决从单张 RGB 图像中估计多人绝对3D姿态的挑战,其中深度与尺度模糊会阻碍准确重建。
- 克服自顶向下方法忽略全局上下文的局限,提出一种自底向上的方法,聚合图像范围内的线索(如身体尺寸、场景布局和人与人之间的关系)。
- 通过显式建模人与人之间的深度关系,提升3D姿态估计性能,尤其是在遮挡或重叠场景下。
- 开发统一的单次前向传播框架,联合回归2D关键点热力图、部件亲和力场、相对深度图与根深度图,以提升3D姿态的一致性。
提出的方法
- 该方法使用全卷积神经网络回归根深度图,直接从输入图像预测每个个体根关节的深度,以3D姿态标注作为监督信号。
- 联合预测2D关键点热力图与部件亲和力场(PAFs),以自底向上的方式定位并关联个体间的身体部件。
- 提出一种新型的部件相对深度图,用于编码每个身体部件中两个关节之间的相对深度,从而在部件关联过程中实现深度感知推理。
- 深度感知的部件关联算法利用预测的深度信息解决遮挡问题,并施加合理的骨骼长度约束,提升关键点分组的准确性。
- 通过结合2D关键点关联结果、预测的根深度与相对深度图,重建最终的3D姿态,确保绝对3D位置的一致性。
- 整个流程以端到端方式训练,使模型能够全局学习与深度相关的线索。
实验结果
研究问题
- RQ1单阶段、自底向上的框架是否能有效利用全局图像上下文与深度线索,实现多人绝对3D姿态的准确估计?
- RQ2直接从图像中预测身体深度相比事后回归深度,如何提升3D姿态估计与部件关联的性能?
- RQ3深度感知的部件关联在重叠或遮挡的人体中,能在多大程度上减少错误?
- RQ4所提方法是否能泛化到真实场景视频,并在 CMU Panoptic 与 MuPoTS-3D 等基准数据集上达到最先进性能?
- RQ5根深度与相对深度监督对整体3D姿态估计精度的贡献如何?
主要发现
- SMAP 在 CMU Panoptic 数据集上达到最先进性能,Human3.6M 数据集上 PCK@0.2 绝对精度达 89.2%,平均 MPJPE 为 54.1 mm。
- 在 MuPoTS-3D 数据集上,SMAP 的 PCK rel 得分为 80.5%,PCK abs 得分为 38.7%,在序列级与匹配真实值评估中均优于先前方法。
- 消融实验表明,加入根深度监督后,PCK root 从 29.9%(仅2D)提升至 45.5%,证明了深度监督的价值。
- 深度感知的部件关联算法通过利用深度预测结果解决歧义,显著降低了遮挡场景下的关键点关联错误。
- 完整模型(包含根深度、相对深度与2D分支)在 MuPoTS-3D 数据集上达到 92.3% 的召回率,显著优于仅根深度的变体(85.0% 召回率)。
- SMAP 在真实场景视频中表现出良好的泛化能力,如在复杂、无约束场景中多人重叠与遮挡的定性结果所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。