Skip to main content
QUICK REVIEW

[论文解读] Learning 3D Human Pose from Structure and Motion

Rishabh Dabral, Anurag Mundhada|arXiv (Cornell University)|Nov 25, 2017
Human Pose and Action Recognition参考文献 40被引用 7
一句话总结

该论文提出了一种弱监督三维人体姿态估计框架,利用解剖学启发的损失函数——关节角度限制和左右对称性——并结合时间姿态优化网络,以提升在真实场景下的泛化能力。通过在大规模2D和合成3D数据上进行训练,该方法在Human3.6M和MPI-INF-3DHP数据集上分别实现了11.8%和12%的性能提升,且在消费级GPU上达到30 FPS的实时推理速度。

ABSTRACT

3D human pose estimation from a single image is a challenging problem, especially for in-the-wild settings due to the lack of 3D annotated data. We propose two anatomically inspired loss functions and use them with a weakly-supervised learning framework to jointly learn from large-scale in-the-wild 2D and indoor/synthetic 3D data. We also present a simple temporal network that exploits temporal and structural cues present in predicted pose sequences to temporally harmonize the pose estimations. We carefully analyze the proposed contributions through loss surface visualizations and sensitivity analysis to facilitate deeper understanding of their working mechanism. Our complete pipeline improves the state-of-the-art by 11.8% and 12% on Human3.6M and MPI-INF-3DHP, respectively, and runs at 30 FPS on a commodity graphics card.

研究动机与目标

  • 解决由于真实世界三维标注数据稀缺,导致在非约束、真实场景下进行三维人体姿态估计的挑战。
  • 通过在训练过程中引入关节角度限制和左右对称性等解剖学约束,提升三维姿态估计模型的泛化能力。
  • 在不引入延迟滤波器的前提下,提升基于视频的姿态估计的时间一致性。
  • 实现实时推理(30 FPS),同时在基准数据集上超越现有方法。
  • 展示可微分、可学习的结构先验在端到端深度学习框架中用于三维姿态估计的有效性。

提出的方法

  • 提出一种结构感知损失函数,通过惩罚违反关节角度限制的预测三维姿态,确保解剖学上合理的姿态配置。
  • 提出一种对称性损失,通过最小化对应左右骨骼对之间的L1距离,以强制实现双侧对称性。
  • 将这些损失与先前工作中提出的骨长比先验相结合,形成全面的解剖学正则化方案。
  • 设计一种滑动窗口全连接时间网络,以N个连续预测姿态作为输入,用于优化运动连贯性。
  • 在大规模真实世界2D和室内/合成3D数据集上,采用弱监督学习方式进行端到端训练。
  • 通过损失曲面可视化和敏感性分析,解释所提损失函数的行为及其影响。

实验结果

研究问题

  • RQ1可微分、可学习的解剖学约束(如关节角度限制和对称性)是否能提升在非约束场景下三维姿态估计的泛化能力?
  • RQ2与先前的骨长比先验相比,结构感知损失在性能和解剖学有效性方面表现如何?
  • RQ3一个简单的时序网络在不引入延迟的情况下,能在多大程度上提升姿态平滑性并减少抖动?
  • RQ4结构建模与时序建模的结合是否能实现在Human3.6M和MPI-INF-3DHP等标准基准上的SOTA性能?
  • RQ5通过损失曲面分析,所提损失函数如何影响优化景观?

主要发现

  • 所提出的结构感知损失函数将非法关节角度比例降低至0.8%(对比[41]中的1.4%),显著提升了姿态的解剖学合理性。
  • SAP-Net在Human3.6M数据集上(Protocol 1)达到55.5mm MPJPE,相比SOTA提升11.8%。
  • 加入时序模型(TP-Net)后,Human3.6M上的MPJPE进一步降低至52.1mm,实现额外7%的性能提升。
  • 在MPI-INF-3DHP数据集上,方法达到103.8mm MPJPE,相比之前SOTA提升12%,且未使用绿幕数据增强。
  • 对称性损失使左右骨骼对之间的平均L1距离减少31.7%(上臂)至42.8%(大腿),表明对称性强制效果显著。
  • TP-Net将帧间骨长标准差降低28.7%,表明在无需后处理滤波器的情况下,显著提升了时间稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。