Skip to main content
QUICK REVIEW

[论文解读] Generating Multiple Hypotheses for 3D Human Pose Estimation with Mixture Density Network

Chen Li, Gim Hee Lee|arXiv (Cornell University)|Apr 11, 2019
Human Pose and Action Recognition参考文献 29被引用 21
一句话总结

该论文提出一种混合密度网络(MDN),从2D关节点输入生成多个在几何上可行的3D人体姿态假设,以解决单目3D姿态估计中的深度模糊性和遮挡问题。通过将3D姿态分布建模为高斯混合模型,该方法生成多个一致的假设,其在输入2D关节点上的重投影结果准确,实现在Human3.6M数据集上的最先进性能,并在MPII和MPI-INF-3DHP数据集上展现出强大的泛化能力。

ABSTRACT

3D human pose estimation from a monocular image or 2D joints is an ill-posed problem because of depth ambiguity and occluded joints. We argue that 3D human pose estimation from a monocular input is an inverse problem where multiple feasible solutions can exist. In this paper, we propose a novel approach to generate multiple feasible hypotheses of the 3D pose from 2D joints.In contrast to existing deep learning approaches which minimize a mean square error based on an unimodal Gaussian distribution, our method is able to generate multiple feasible hypotheses of 3D pose based on a multimodal mixture density networks. Our experiments show that the 3D poses estimated by our approach from an input of 2D joints are consistent in 2D reprojections, which supports our argument that multiple solutions exist for the 2D-to-3D inverse problem. Furthermore, we show state-of-the-art performance on the Human3.6M dataset in both best hypothesis and multi-view settings, and we demonstrate the generalization capacity of our model by testing on the MPII and MPI-INF-3DHP datasets. Our code is available at the project website.

研究动机与目标

  • 为解决从单目图像或2D关节点进行3D人体姿态估计时固有的模糊性问题,即多个3D姿态可能投影到相同的2D关节点配置。
  • 突破传统单估计方法的局限,后者在单峰高斯假设下最小化均方误差,可能导致过拟合并无法捕捉不确定性。
  • 利用混合密度网络(MDN)建模可行3D姿态的多模态特性,实现多个一致假设的生成。
  • 通过学习不确定性感知的姿态分布,提升对未见域和挑战性姿态(包括遮挡关节点)的泛化能力。
  • 在基准数据集上,于最佳假设和多视角设置下均实现最先进性能。

提出的方法

  • 该方法采用两阶段框架:首先由2D姿态估计器提供输入关节点,随后通过基于混合密度网络(MDN)的3D姿态假设生成器生成3D姿态。
  • MDN将3D姿态分布建模为M个高斯核的混合,输出包括各核的混合系数、均值和方差。
  • 通过最小化高斯混合分布的负对数似然进行训练,相比单峰回归更能捕捉多模态不确定性。
  • 为混合系数引入狄利克雷共轭先验,以防止在罕见或模糊姿态上过拟合至单一高斯核。
  • 3D姿态假设由M个高斯核的均值生成,并通过其在2D关节点上的重投影一致性进行评估。
  • 模型通过全连接层与非线性激活函数端到端训练,训练过程中未施加额外的2D一致性约束。

实验结果

研究问题

  • RQ1深度学习模型能否从同一组2D关节点输入生成多个与之一致的合理3D人体姿态假设,以反映3D重建问题的固有模糊性?
  • RQ2将3D姿态分布建模为高斯混合(MDN)是否相比基于均方误差的单峰回归能带来更好的性能与不确定性估计?
  • RQ3所提模型在无3D训练标签的数据集(如MPII和MPI-INF-3DHP)上泛化能力如何?
  • RQ4在未显式引入2D一致性损失的情况下,生成的假设在2D重投影上的一致性程度如何?
  • RQ5引入狄利克雷先验在提升罕见或模糊姿态(如'SittingDown'或'GettingDown')的鲁棒性方面效果如何?

主要发现

  • 所提出的基于MDN的方法在Human3.6M数据集上,无论在最佳假设还是多视角设置下,均达到最先进性能,优于先前方法。
  • 模型生成的3D姿态假设在2D重投影上表现出高度一致性,PCKh@0.5得分接近1.0,表明所有假设几乎完全一致地投影到输入2D关节点。
  • 在MPII和MPI-INF-3DHP数据集上(未使用3D训练数据),模型仍展现出良好泛化能力,3DPCK结果略低于但与同类在相同数据上训练的模型相当。
  • 消融实验表明,使用M=5个高斯核在性能与计算成本之间达到最佳平衡,当M>5时性能趋于饱和。
  • 狄利克雷先验显著提升了在挑战性姿态(如'Sitting'和'SittingDown')上的性能,减少了对训练数据中主导的'Standing'姿态的过拟合。
  • 模型仅在模糊姿态(如'GettingDown'、'SittingDown')上生成显著不同的假设,而简单姿态(如'Standing')则生成相似假设,证实模型能恰当捕捉不确定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。