Skip to main content
QUICK REVIEW

[论文解读] A Review on Human Pose Estimation

Rohit Josyula, Sarah Ostadabbas|arXiv (Cornell University)|Oct 13, 2021
Human Pose and Action Recognition参考文献 36被引用 13
一句话总结

本综述对计算机视觉中的人体姿态估计(HPE)提供了全面概述,涵盖经典方法如形态结构(Pictorial Structures)和灵活混合模型(Flexible Mixture-of-Parts),并过渡到基于深度学习的方法,如卷积姿态机(Convolutional Pose Machine, CPM)。综述评估了2D与3D HPE在人体、面部和手部模态下的度量标准、数据集与基准测试,主要贡献包括对标准的系统性分类、性能度量的详细分析,以及对最先进模型和开源实现的精选调研。

ABSTRACT

The phenomenon of Human Pose Estimation (HPE) is a problem that has been explored over the years, particularly in computer vision. But what exactly is it? To answer this, the concept of a pose must first be understood. Pose can be defined as the arrangement of human joints in a specific manner. Therefore, we can define the problem of Human Pose Estimation as the localization of human joints or predefined landmarks in images and videos. There are several types of pose estimation, including body, face, and hand, as well as many aspects to it. This paper will cover them, starting with the classical approaches to HPE to the Deep Learning based models.

研究动机与目标

  • 提供计算机视觉中人体姿态估计(HPE)的古典方法与基于深度学习方法的结构化综述。
  • 分析并比较HPE研究中使用的性能度量标准、规范与评估协议。
  • 对2D与3D HPE在人体、面部和手部模态下的主要数据集进行分类与总结。
  • 考察从单图姿态估计到视频姿态估计的算法演进,包括架构创新。
  • 整理并评估最先进模型与开源实现,以供实际研究与应用使用。

提出的方法

  • 调研经典HPE技术,如形态结构与灵活混合模型(FMP),这些方法通过图模型对身体部位施加空间与外观约束。
  • 分析卷积姿态机(CPM),一种基于深度学习的框架,利用多阶段卷积网络结合热力图与上下文建模,以优化关键点预测。
  • 使用标准度量如平均平均精度(mAP)、PCK与MPJPE评估性能,重点关注2D与3D关键点定位精度。
  • 根据模态(2D/3D)、身体部位(人体、面部、手部)与输入类型(图像与视频)对HPE系统进行分类,重点关注架构与数据处理流程的差异。
  • 系统性地整理GitHub仓库与单图及视频HPE的模型实现,包括模型架构、输入处理与训练协议。
  • 按模态与标注类型对数据集进行映射,包括2D/3D关键点标注,并评估其规模与多样性(如COCO、MPII、300W、FreiHand、WFLW)

实验结果

研究问题

  • RQ1古典方法如形态结构与FMP如何建模人体关节运动?其在处理遮挡与形变方面存在哪些局限性?
  • RQ2哪些架构创新推动了从古典方法向基于深度学习的HPE转变,特别是在卷积姿态机等模型中?
  • RQ3不同评估度量(如mAP、PCK、MPJPE)如何反映HPE模型在2D与3D姿态估计任务中的性能表现?
  • RQ4在人体、面部与手部姿态估计基准中,数据集设计、标注质量与规模的关键差异是什么?
  • RQ5视频姿态估计模型如何利用时间上下文提升精度,相较于单图方法有何优势?

主要发现

  • 古典方法如形态结构与FMP为HPE奠定了基础,但在遮挡、形变与缺乏全局上下文方面存在局限,推动了深度学习的采用。
  • 卷积姿态机(CPM)引入了多阶段、端到端可微的深度学习框架,通过堆叠的沙漏模块与热力图显著提升了关键点定位精度。
  • 在COCO数据集上,基于HRNet与SimpleBaseline等现代架构的最先进2D人体姿态估计模型mAP得分超过70%。
  • 3D HPE模型如VoxelPose与GAST-Net通过多视角监督与时间建模,在Human3.6M数据集上实现低于100mm的MPJPE误差,展现出强大的泛化能力。
  • 对于3D手部姿态估计,如Hand3D及采用基于深度的增强方法(如HandAugment)的模型,在FreiHand与Panoptic-Hands1.0数据集上实现低于20mm的中位数误差。
  • 视频姿态估计模型如VideoPose3D与DetectAndTrack通过利用时间一致性与循环或3D-CNN建模,提升了精度,减少了抖动并增强了鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。