Skip to main content
QUICK REVIEW

[论文解读] 3D Human Pose Estimation = 2D Pose Estimation + Matching

Ching-Hang Chen, Deva Ramanan|arXiv (Cornell University)|Dec 20, 2016
Human Pose and Action Recognition参考文献 33被引用 13
一句话总结

该论文提出了一种简单但非常有效的两阶段方法,用于从单张RGB图像进行3D人体姿态估计:首先使用深度神经网络估计2D姿态,然后通过非参数化匹配方式将姿态提升至3D,匹配对象为大规模3D动作捕捉姿态库。该方法在Human3.6M等基准数据集上优于几乎所有先前的最先进方法,在推理时间小于200ms的情况下实现了SOTA性能,同时利用现成的2D姿态模型和3D动捕数据。

ABSTRACT

We explore 3D human pose estimation from a single RGB image. While many approaches try to directly predict 3D pose from image measurements, we explore a simple architecture that reasons through intermediate 2D pose predictions. Our approach is based on two key observations (1) Deep neural nets have revolutionized 2D pose estimation, producing accurate 2D predictions even for poses with self occlusions. (2) Big-data sets of 3D mocap data are now readily available, making it tempting to lift predicted 2D poses to 3D through simple memorization (e.g., nearest neighbors). The resulting architecture is trivial to implement with off-the-shelf 2D pose estimation systems and 3D mocap libraries. Importantly, we demonstrate that such methods outperform almost all state-of-the-art 3D pose estimation systems, most of which directly try to regress 3D pose from 2D measurements.

研究动机与目标

  • 为解决从单张RGB图像进行3D人体姿态估计的问题,提出一种简单、模块化的处理流程。
  • 探究准确的2D姿态估计是否可作为3D提升的强中间表征,即使在遮挡情况下亦然。
  • 评估利用大规模3D动捕数据进行非参数化3D范例匹配在深度预测中的有效性。
  • 通过结合多样化的2D数据集与3D动捕库,实现对非受限‘野外’图像的良好泛化能力。
  • 为未来3D姿态估计研究建立一个强大且简单的基线,其性能优于复杂的端到端模型。

提出的方法

  • 该方法首先使用预训练的2D姿态估计器(例如基于CNN的热力图模型)从单张RGB图像中预测2D关节点坐标。
  • 然后将预测的2D姿态投影到多个虚拟摄像机视角,生成大量合成的(2D, 3D)姿态对用于训练。
  • 通过非参数化匹配步骤,基于2D投影关节点坐标之间的L2距离,在库中寻找最近邻的3D姿态。
  • 为提高匹配精度,应用一种闭式变形程序,将匹配3D姿态的2D投影与预测的2D关节点对齐。
  • 最终的3D姿态通过选择在变形后其2D投影与预测2D关节点最匹配的3D姿态从库中获得。
  • 整个流程在Human3.6M等数据集的标准划分上进行训练与评估,性能通过MPJPE(关节点位置误差均值)进行衡量。

实验结果

研究问题

  • RQ1是否两阶段流程(先估计2D姿态,再将其提升至3D)能优于端到端的3D回归方法?
  • RQ22D姿态估计在遮挡情况下的准确性在多大程度上影响最终3D姿态的性能?
  • RQ33D范例库的大小如何影响基于匹配的3D提升精度?
  • RQ4在实验室环境下训练的3D姿态库能否泛化到非受限的‘野外’图像?
  • RQ5变形处理是否能显著提升在不同数据集上的泛化能力与匹配精度?

主要发现

  • 所提方法在Human3.6M数据集上优于几乎所有先前的SOTA 3D姿态估计系统,在使用变形处理时,MPJPE均值为57.5 mm(协议1下),不使用时为70.93 mm。
  • 该方法在HumanEva-I数据集上也表现出良好泛化能力,当使用在Human3.6M上训练的模型时,平均MPJPE从92.17 mm(未变形)降低至68.29 mm(变形后)。
  • 性能随更大的3D姿态库而提升,当使用CNN预测的2D姿态时,MPJPE在约200,000个范例后趋于饱和;当使用真实2D姿态时,饱和点在500,000个范例左右。
  • 中位数MPJPE始终低于均值,表明少数异常关节点显著贡献了均值误差,而变形处理有助于减少这些大误差。
  • 整个流程的运行时间在200ms以内(2D估计160ms,使用200,000个姿态库时匹配仅需26ms),展现出极高的效率。
  • 结果表明,2D姿态估计已足够精确——即使在遮挡情况下——因此3D提升的主要挑战已转变为深度估计,而该问题可通过数据驱动的匹配方法有效解决。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。