Skip to main content
QUICK REVIEW

[论文解读] Cascaded Pyramid Network for 3D Human Pose Estimation Challenge

Sungeun Hong, Wonjin Jung|arXiv (Cornell University)|Oct 3, 2018
Human Pose and Action Recognition参考文献 7被引用 3
一句话总结

该论文提出了一种基于级联金字塔网络(CPN)的两阶段3D人体姿态估计框架,用于鲁棒的2D关键点检测,并采用基于残差块的2D到3D提升网络。该方法在ECCV 2018 PoseTrack验证集上实现了42.39的平均关节点位置误差(MPJPE),展示了在处理单目3D姿态估计中遮挡关节约束时的优异性能。

ABSTRACT

Over the past decade, there has been a growing interest in human pose estimation. Although much work has been done on 2D pose estimation, 3D pose estimation has still been relatively studied less. In this paper, we propose a top-bottom based two-stage 3D estimation framework. GloabalNet and RefineNet in our 2D pose estimation process enable us to find occluded or invisible 2D joints while 2D-to-3D pose estimator composed of residual blocks is used to lift 2D joints to 3D joints effectively. The proposed method achieves promising results with mean per joint position error at 42.39 on the validation dataset on `3D Human Pose Estimation within the ECCV 2018 PoseTrack Challenge.'

研究动机与目标

  • 解决从单目RGB图像进行3D人体姿态估计的挑战,特别是处理被遮挡或不可见的2D关节点。
  • 通过两阶段流程(先估计2D姿态,再将其提升为3D)提升3D姿态估计的准确性。
  • 通过裁剪与重缩放(CR)模块,增强模型在训练集(Human3.6M)与测试集(PoseTrack)之间尺度差异下的鲁棒性。
  • 通过使用批量归一化和最大范数约束的残差块优化2D到3D提升网络,以实现训练的稳定性。
  • 在ECCV 2018 PoseTrack 3D人体姿态估计挑战赛中实现最先进性能。

提出的方法

  • 采用自顶向下结构的CPN架构,结合GlobalNet与RefineNet进行2D关键点检测,其中GlobalNet利用特征金字塔网络和中间监督以保留空间与语义信息。
  • 通过引入RefineNet并结合在线难样本关键点挖掘损失,聚合多级特征以提升对被遮挡或不可见关节点的估计性能。
  • 在CPN推理前和后分别引入裁剪与重缩放(CR)模块,以及逆向裁剪与重缩放(ICR)模块,以归一化Human3.6M与挑战数据集之间的尺度差异。
  • 使用带有批量归一化和最大范数权重约束的残差块训练2D到3D姿态估计器,以稳定训练并提升泛化能力。
  • 通过以髋关节为中心的零均值化和标准化处理2D与3D姿态,以改善模型收敛性。
  • 将2D到3D提升过程建模为对一批样本的均方误差损失最小化问题,使用公式(1)作为目标函数。

实验结果

研究问题

  • RQ1两阶段3D姿态估计流程在真实视频序列中是否能在准确性和鲁棒性方面优于单阶段方法?
  • RQ2级联金字塔网络(CPN)结合GlobalNet与RefineNet在检测被遮挡或不可见的2D关键点方面效果如何?
  • RQ3当将基于Human3.6M训练的2D姿态模型迁移到具有不同主体尺度的PoseTrack数据集时,裁剪与重缩放(CR)模块在多大程度上提升了性能?
  • RQ42D到3D提升网络的最优架构与正则化策略(如批量归一化、最大范数)是什么?
  • RQ5残差块、归一化与权重约束的组合如何影响最终的3D姿态估计误差?

主要发现

  • 所提方法在ECCV 2018 PoseTrack 3D人体姿态估计挑战赛验证集上实现了42.39的平均关节点位置误差(MPJPE)。
  • 消融实验表明,同时使用批量归一化与最大范数约束可将MPJPE降低至43.72,显著优于不包含这些组件的配置。
  • 引入裁剪与重缩放(CR)模块后,性能相比基线提升17.5%,当与完整正则化结合时,MPJPE从61.71降至45.41。
  • 单个具有1024维的残差块已能实现足够性能,表明2D到3D提升头无需深层网络结构。
  • 模型在复杂情况下的泛化能力表现优异,定性结果表明3D预测结果即使在复杂姿态下也与真实值高度吻合。
  • 使用RefineNet结合在线难样本关键点挖掘损失显著提升了对不可见或被遮挡关节点的检测能力,从而整体提升了精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。