Skip to main content
QUICK REVIEW

[论文解读] Cross View Fusion for 3D Human Pose Estimation

Haibo Qiu, Chunyu Wang|arXiv (Cornell University)|Sep 3, 2019
Human Pose and Action Recognition参考文献 23被引用 10
一句话总结

本文提出一种两阶段方法,用于从多视角图像中进行绝对3D人体姿态估计,通过卷积神经网络中的跨视角特征融合来提升2D姿态估计性能,并采用递归图像结构模型(RPSM)以较低计算成本优化3D姿态。该方法在H36M数据集上实现26 mm的平均关节点位置误差(MPJPE),在Total Capture数据集上实现29 mm,误差降低超过50%,性能达到当前最先进水平。

ABSTRACT

We present an approach to recover absolute 3D human poses from multi-view images by incorporating multi-view geometric priors in our model. It consists of two separate steps: (1) estimating the 2D poses in multi-view images and (2) recovering the 3D poses from the multi-view 2D poses. First, we introduce a cross-view fusion scheme into CNN to jointly estimate 2D poses for multiple views. Consequently, the 2D pose estimation for each view already benefits from other views. Second, we present a recursive Pictorial Structure Model to recover the 3D pose from the multi-view 2D poses. It gradually improves the accuracy of 3D pose with affordable computational cost. We test our method on two public datasets H36M and Total Capture. The Mean Per Joint Position Errors on the two datasets are 26mm and 29mm, which outperforms the state-of-the-arts remarkably (26mm vs 52mm, 29mm vs 35mm). Our code is released at \url{https://github.com/microsoft/multiview-human-pose-estimation-pytorch}.

研究动机与目标

  • 从多视角校准图像中估计世界坐标系下的绝对3D人体姿态。
  • 通过利用多视角几何一致性,解决在遮挡或运动模糊条件下2D姿态估计不准确的问题。
  • 与传统图像结构模型(PSM)相比,减少量化误差和3D姿态恢复的计算成本。
  • 开发一种方法,使其在无需人工标注的情况下可泛化至新的相机设置。

提出的方法

  • 使用跨视角特征融合的卷积神经网络,联合估计多个视角下的2D姿态,通过视角间特征交互提升精度。
  • 融合网络可端到端地与任意2D姿态估计器集成,无需中间监督。
  • 提出一种递归图像结构模型(RPSM),通过在前一次估计周围逐步细化的网格上迭代优化关节点位置,实现3D姿态恢复。
  • RPSM在每次迭代中使用较小的网格尺寸(例如,N=8),相比全空间离散化显著降低推理成本。
  • 该方法同时最小化投影误差,并在关节点之间强制施加空间先验结构。
  • 该方法可端到端训练,并可与现有的2D姿态估计器结合使用。

实验结果

研究问题

  • RQ1在遮挡或模糊等复杂条件下,跨视角特征融合是否能提升多视角设置下2D姿态估计的准确性?
  • RQ2递归细化策略是否能在保持计算效率的同时减少3D姿态估计中的量化误差?
  • RQ3在公开基准测试中,该方法在3D姿态估计精度方面与当前最先进方法相比表现如何?
  • RQ4该模型是否能在仅使用伪标签数据的情况下,无需人工标注即泛化至新的相机设置?

主要发现

  • 所提方法在H36M数据集上实现26 mm的平均关节点位置误差(MPJPE),相比之前最先进方法(52 mm)误差降低超过50%。
  • 在Total Capture数据集上,该方法实现29 mm的MPJPE,相比先前最佳方法(35 mm)误差降低17%。
  • 跨视角特征融合使H36M数据集上的2D姿态检测率从89%提升至96%,尤其在手腕等困难关节点上提升最为显著。
  • RPSM中的递归细化策略使3D姿态误差相比标准PSM降低至少50%,且推理时间增加极少。
  • 该方法在新相机设置上泛化能力出色:仅使用MPII数据集的伪标签数据,即可将H36M数据集上的MPJPE从109 mm降低至43 mm。
  • 融合模块显著提升性能:在Total Capture数据集上,单视角RPSM的MPJPE为41 mm,而融合-RPSM的MPJPE降至29 mm。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。