Skip to main content
QUICK REVIEW

[论文解读] Monocular 3D Human Pose Estimation Using Transfer Learning and Improved CNN Supervision

Dushyant Mehta, Helge Rhodin|arXiv (Cornell University)|Nov 29, 2016
Human Pose and Action Recognition被引用 34
一句话总结

该论文提出了一种基于CNN的新方法,用于单目3D人体姿态估计,通过利用骨骼运动学关系改进CNN监督,并结合多级跳跃连接,同时从2D姿态模型迁移学习,使标准基准上的性能提升超过25%。该研究还引入了一个新的多样化、无标记点的动作捕捉基准,以提升模型在真实世界中的泛化能力。

ABSTRACT

We propose a new CNN-based method for regressing 3D human body pose from a single image that improves over the state-of-the-art on standard benchmarks by more than 25%. Our approach addresses the limited generalizability of models trained solely on the starkly limited publicly available 3D body pose data. Improved CNN supervision leverages first and second order parent relationships along the skeletal kinematic tree, and improved multi-level skip connections to learn better representations through implicit modification of the loss landscape. Further, transfer learning from 2D human pose prediction significantly improves accuracy and generalizability to unseen poses and camera views. Additionally, we contribute a new benchmark and training set for human body pose estimation from monocular images of real humans, that has ground truth captured with marker-less motion capture. It complements existing corpora with greater diversity in pose, human appearance, clothing, occlusion, and viewpoints, and enables increased scope of augmentation. The benchmark covers outdoors and indoor scenes.

研究动机与目标

  • 解决在稀缺公开3D姿态数据上训练的3D人体姿态模型泛化能力有限的问题。
  • 通过利用骨骼运动学关系改进CNN监督,提升特征表示学习能力。
  • 通过从2D姿态预测模型迁移学习,提升模型对未见姿态和相机视角的泛化能力。
  • 构建一个包含真实世界变化(如姿态、外观、服装、遮挡和视角)的新基准,用于单目3D姿态估计。
  • 利用无标记点动作捕捉的真实数据,支持更广泛的数据增强和更鲁棒的评估。

提出的方法

  • 通过骨骼运动学树中的一阶和二阶父级关系改进CNN监督。
  • 使用改进的多级跳跃连接,以改变损失曲面并学习更优的层次化表示。
  • 通过使用预训练2D人体姿态估计网络的权重初始化模型,应用迁移学习。
  • 使用增强的监督信号,在3D关节点坐标上端到端训练网络,采用回归损失。
  • 利用无标记点动作捕捉构建新基准,收集具有3D真实值的多样化真实世界单目图像序列。
  • 训练数据包含多样的姿态、人体外观、服装、遮挡以及室内外场景,以提升鲁棒性。

实验结果

研究问题

  • RQ1如何通过骨骼运动学关系改进CNN监督,以提升3D姿态估计的准确性?
  • RQ2从2D姿态模型迁移学习在多大程度上能提升对未见姿态和相机视角的泛化能力?
  • RQ3多级跳跃连接能否有效改变损失曲面,从而改善3D姿态回归中的特征学习?
  • RQ4一个包含无标记点动作捕捉数据的多样化真实世界基准,如何影响模型性能与评估?
  • RQ5所提方法在标准基准上相比SOTA的性能提升是多少?

主要发现

  • 与SOTA相比,所提方法在标准基准上的性能提升超过25%。
  • 通过一阶和二阶父级监督整合骨骼运动学关系,显著提升了模型精度。
  • 从2D姿态预测迁移学习显著改善了对未见姿态和相机视角的泛化能力。
  • 改进的多级跳跃连接通过隐式改变损失曲面,促进了更好的特征表示学习。
  • 使用无标记点动作捕捉数据构建的新基准,支持更丰富多样的训练与评估,促进更广泛的数据增强与泛化能力。
  • 该方法在遮挡、不同服装和复杂视角等多种真实世界条件下表现出强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。