Skip to main content
QUICK REVIEW

[论文解读] Motion Guided 3D Pose Estimation from Videos

Jingbo Wang, Sijie Yan|arXiv (Cornell University)|Apr 29, 2020
Human Pose and Action Recognition参考文献 43被引用 10
一句话总结

该论文提出了一种运动损失函数和一种U形图卷积网络(UGCN),用于从2D视频序列中进行单目3D人体姿态估计。通过采用成对运动编码对关键点运动进行建模,该方法提升了时序一致性和准确性,在Human3.6M和MPI-INF-3DHP数据集上分别取得了25.6 mm MPJPE和68.1 mm MPJPE的最先进性能。

ABSTRACT

We propose a new loss function, called motion loss, for the problem of monocular 3D Human pose estimation from 2D pose. In computing motion loss, a simple yet effective representation for keypoint motion, called pairwise motion encoding, is introduced. We design a new graph convolutional network architecture, U-shaped GCN (UGCN). It captures both short-term and long-term motion information to fully leverage the additional supervision from the motion loss. We experiment training UGCN with the motion loss on two large scale benchmarks: Human3.6M and MPI-INF-3DHP. Our model surpasses other state-of-the-art models by a large margin. It also demonstrates strong capacity in producing smooth 3D sequences and recovering keypoint motion.

研究动机与目标

  • 为解决标准Minkowski距离损失在3D姿态估计过程中难以捕捉时序运动结构的局限性。
  • 通过显式建模运动动力学,提升预测3D姿态序列的平滑性和自然性。
  • 设计一种能够捕捉姿态序列中短期和长期时序依赖关系的深度学习架构。
  • 证明基于运动的监督可显著提升3D姿态估计的准确性,超越标准3D位置损失。
  • 使用2D姿态输入建立视频驱动的3D人体姿态估计新基准。

提出的方法

  • 提出一种新颖的运动损失函数,利用可微的成对运动编码表示,评估预测与真实关键点运动轨迹之间的相似性。
  • 将运动编码定义为在不同时间间隔下,2D/3D关键点位置之间成对向量(例如通过减法)的拼接,以捕捉多尺度运动动力学。
  • 提出一种受U-Net启发的U形图卷积网络(UGCN)架构,旨在建模长程时序依赖关系,同时保留3D姿态序列中的细粒度运动细节。
  • 通过结合标准3D关键点回归(ℓ2损失)和所提出的运动损失的多任务损失进行UGCN模型训练,以提升时序一致性。
  • 使用最先进检测器(如CPN、HR-Net)输出的2D姿态序列作为模型输入,实现从单目视频端到端的学习。
  • 采用图卷积网络建模骨骼运动学,通过可微运动编码进行反向传播更新可学习权重。

实验结果

研究问题

  • RQ1通过新颖损失函数显式建模运动,能否提升单目视频估计中3D姿态序列的时序一致性?
  • RQ2与标准ℓ2/ℓ1损失相比,所提出的运动损失在3D姿态准确性和序列平滑性方面表现如何?
  • RQ3U形GCN架构能否有效捕捉3D姿态序列中的短期和长期运动依赖关系?
  • RQ4基于运动的监督在多大程度上可减少速度误差并改善预测姿态序列的自然运动?
  • RQ5运动损失与UGCN的结合是否在标准基准上超越现有最先进方法?

主要发现

  • 在使用真实2D姿态输入的条件下,该方法在Human3.6M数据集上Protocol 2下达到25.6 mm MPJPE,优于所有先前方法。
  • 引入运动损失后,MPJVE降低32%(从3.4 mm降至2.3 mm),表明运动平滑性显著提升。
  • 在MPI-INF-3DHP数据集上,该方法达到86.9 PCK、62.1 AUC和68.1 mm MPJPE,创下新的最先进性能。
  • 运动损失显著提升了姿态序列质量,复杂动作和大范围运动的定性可视化结果充分证明了这一点。
  • UGCN架构结合运动损失在泛化能力和鲁棒性方面表现更优,尤其在处理高速和复杂运动序列时。
  • 消融实验表明,仅使用运动损失即可提升性能,而其与UGCN的结合在所有指标上均取得最佳结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。