Skip to main content
QUICK REVIEW

[论文解读] 3D human pose estimation in video with temporal convolutions and semi-supervised training

Dario Pavllo, Christoph Feichtenhofer|arXiv (Cornell University)|Nov 28, 2018
Human Pose and Action Recognition被引用 4
一句话总结

该论文提出了一种使用空洞时间卷积对2D关键点轨迹进行建模的全卷积3D人体姿态估计模型,在Human3.6M数据集上相比之前的工作将平均关节点位置误差(MPJPE)降低了6 mm(相对提升11%)。此外,该工作引入了反投影(back-projection)方法,一种半监督训练策略,通过利用未标注视频预测3D姿态并反投影回2D空间,当标注数据稀缺时,可将误差降低最多14.7 mm MPJPE。

ABSTRACT

In this work, we demonstrate that 3D poses in video can be effectively estimated with a fully convolutional model based on dilated temporal convolutions over 2D keypoints. We also introduce back-projection, a simple and effective semi-supervised training method that leverages unlabeled video data. We start with predicted 2D keypoints for unlabeled video, then estimate 3D poses and finally back-project to the input 2D keypoints. In the supervised setting, our fully-convolutional model outperforms the previous best result from the literature by 6 mm mean per-joint position error on Human3.6M, corresponding to an error reduction of 11%, and the model also shows significant improvements on HumanEva-I. Moreover, experiments with back-projection show that it comfortably outperforms previous state-of-the-art results in semi-supervised settings where labeled data is scarce. Code and models are available at https://github.com/facebookresearch/VideoPose3D

研究动机与目标

  • 通过比循环模型更有效地利用时间上下文,提升视频中3D人体姿态估计的性能。
  • 通过引入一种无需2D真实值或多视角数据的半监督方法,缓解3D姿态标注数据稀缺的问题。
  • 开发一种既准确又高效的模型,支持并行处理,相比RNN方法具有更低的计算复杂度。
  • 证明反投影(一种受循环一致性启发的方法)在标注数据有限时能有效提升泛化能力。

提出的方法

  • 采用全卷积架构结合空洞时间卷积,以建模2D关键点轨迹中的长程依赖关系。
  • 应用空洞卷积在低计算成本下实现大感受野,从而高效建模长序列。
  • 提出反投影:一种半监督训练方案,通过从2D关键点预测3D姿态并反投影回2D空间,形成一致性损失。
  • 引入骨骼长度正则化项,以强制执行运动学一致性,提升反投影过程中的姿态有效性。
  • 使用标注数据的监督损失与通过反投影从未标注视频中获得的一致性损失联合训练模型。
  • 在反投影步骤中仅使用相机内参,避免对相机外参或未标注数据中2D真实值的依赖。

实验结果

研究问题

  • RQ1全卷积模型结合空洞时间卷积是否能在视频3D人体姿态估计任务中超越RNN基模型?
  • RQ2基于循环一致性的半监督方法反投影,是否能在标注数据有限时有效提升3D姿态估计性能?
  • RQ3当标注数据量减少时,所提方法的性能如何变化,特别是在资源受限的场景下?
  • RQ4通过骨骼长度正则化强制施加运动学约束,在半监督训练中在多大程度上提升了泛化能力?

主要发现

  • 所提出的全卷积模型在Human3.6M数据集上将平均关节点位置误差从53.1 mm降低至47.1 mm,减少了6 mm,相对SOTA提升11%。
  • 在HumanEva-I数据集上也优于先前方法,表明其泛化能力超越了Human3.6M基准。
  • 在仅使用5,000帧或更少标注帧的半监督设置下,反投影方法相比强监督基线将误差降低最多14.7 mm MPJPE。
  • 当使用真实2D关键点检测结果进行训练时,半监督方法在S1数据集1%的标注数据下相比监督基线误差降低最多22.6 mm MPJPE,凸显了更优2D关键点检测器的潜力。
  • 在反投影中移除骨骼长度正则化项后,S1数据集1%的误差从78.1 mm上升至91.3 mm,证明该正则化项在维持姿态有效性方面具有关键作用。
  • 模型在单张GPU上实现约150k FPS的推理速度,由于时间维度的并行处理,速度与批大小无关,显著优于RNN基模型的效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。