Skip to main content
QUICK REVIEW

[论文解读] Single-Network Whole-Body Pose Estimation

Gines Hidalgo, Yaadhav Raaj|arXiv (Cornell University)|Sep 30, 2019
Human Pose and Action Recognition参考文献 72被引用 13
一句话总结

本文提出首个单阶段、单分支网络的2D全身姿态估计方法,通过多任务学习结合新型网络结构,联合检测人体、面部、手部和脚部关键点,有效处理人体/脚部与面部/手部关键点检测间的尺度差异。该方法实现与人数无关的实时推理,在速度上相比OpenPose提升至n倍(n人为人数),在准确率上尤其在遮挡、模糊或低分辨率的面部和手部检测中表现更优,且训练过程为单阶段,耗时显著减少。

ABSTRACT

We present the first single-network approach for 2D~whole-body pose estimation, which entails simultaneous localization of body, face, hands, and feet keypoints. Due to the bottom-up formulation, our method maintains constant real-time performance regardless of the number of people in the image. The network is trained in a single stage using multi-task learning, through an improved architecture which can handle scale differences between body/foot and face/hand keypoints. Our approach considerably improves upon OpenPose~\cite{cao2018openpose}, the only work so far capable of whole-body pose estimation, both in terms of speed and global accuracy. Unlike OpenPose, our method does not need to run an additional network for each hand and face candidate, making it substantially faster for multi-person scenarios. This work directly results in a reduction of computational complexity for applications that require 2D whole-body information (e.g., VR/AR, re-targeting). In addition, it yields higher accuracy, especially for occluded, blurry, and low resolution faces and hands. For code, trained models, and validation benchmarks, visit our project page: https://github.com/CMU-Perceptual-Computing-Lab/openpose_train.

研究动机与目标

  • 解决多人群场景中同时进行2D全身关键点估计(人体、面部、手部、脚部)时缺乏统一、实时方法的问题。
  • 在单一模型中解决大感受野的人体/脚部关键点检测与高分辨率的面部/手部检测之间的尺度差异问题。
  • 消除类似OpenPose等多阶段方法的计算瓶颈,后者需为每个人分别运行面部和手部检测网络。
  • 通过关键点类型间共享特征学习,提升在遮挡、模糊和低分辨率等困难条件下的泛化能力。
  • 通过在单阶段中联合训练所有关键点任务,减少训练时间与复杂度,避免为每个任务独立训练网络。

提出的方法

  • 提出一种统一的单网络架构,通过多任务学习(MTL)端到端联合回归人体、面部、手部和脚部关键点的热力图。
  • 设计一种新型主干网络,采用多尺度特征融合机制,平衡人体/脚部检测的大感受野需求与面部/手部关键点定位的高分辨率表示。
  • 采用单阶段训练流程,端到端同时优化所有关键点检测头,相比多网络方法将训练时间减少约一半。
  • 应用数据增强与课程学习策略,提升在低分辨率和遮挡面部、手部情况下的泛化能力。
  • 利用自下而上的建模范式(先检测人体关键点,再通过面部/手部分支优化),确保推理时间与人数无关。
  • 采用共享特征提取器与任务特定头模块,每个检测头针对其特定的尺度与空间分辨率需求进行优化。

实验结果

研究问题

  • RQ1一个深度神经网络能否在单次前向传播中高效、准确地估计2D全身关键点配置(人体、面部、手部、脚部)?
  • RQ2在统一架构中,如何在不损失准确率或速度的前提下解决人体/脚部与面部/手部关键点检测之间的尺度差异问题?
  • RQ3在多样化的关键点类型之间进行联合多任务学习,是否能提升模型在遮挡、模糊和低分辨率等真实场景下的泛化能力?
  • RQ4与OpenPose等多阶段、多网络基线相比,单网络方法在计算复杂度与推理时间方面能降低多少?
  • RQ5在大规模多样化数据集上进行训练时,统一模型能否超越为面部和手部检测专门设计的网络?

主要发现

  • 所提出的单网络模型实现与人数无关的实时推理,而OpenPose的推理时间随人数线性增长。
  • 在含10人的图像中,该方法推理速度约为OpenPose的7倍,且在不同人数下推理时间保持稳定。
  • 在Hand MPII数据集上,该深度全身模型达到97.8%的平均召回率(AR),较之前OpenPose单尺度模型提升5.5%。
  • 在具有挑战性的野外图像中,通过定性对比可见,该方法在低分辨率、模糊或遮挡的面部与手部检测中泛化能力更强。
  • 由于采用单阶段联合训练,训练时间减少约一半,无需再为面部和手部检测器分别训练。
  • 尽管性能有所提升,该方法在极端遮挡、运动模糊以及极小或远距离目标上仍存在困难,且在简单、非遮挡姿态下偶尔表现不如OpenPose。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。