Skip to main content
QUICK REVIEW

[论文解读] It's all Relative: Monocular 3D Human Pose Estimation from Weakly Supervised Data

Matteo Ruggero Ronchi, Oisin Mac Aodha|arXiv (Cornell University)|May 17, 2018
Human Pose and Action Recognition被引用 15
一句话总结

本文提出了一种弱监督的3D人体姿态估计方法,仅使用通过众包标注容易获取的相对深度注释,而非昂贵的3D真实值。通过使用稀疏相对深度约束训练基于提升(lifting-based)的模型,该方法在Human3.6M数据集上实现了具有竞争力的性能,尽管监督信号显著弱于全监督方法,但仍能实现与全监督方法相当的性能,从而使得现有2D数据集可被用于开放环境中的3D姿态估计。

ABSTRACT

We address the problem of 3D human pose estimation from 2D input images using only weakly supervised training data. Despite showing considerable success for 2D pose estimation, the application of supervised machine learning to 3D pose estimation in real world images is currently hampered by the lack of varied training images with corresponding 3D poses. Most existing 3D pose estimation algorithms train on data that has either been collected in carefully controlled studio settings or has been generated synthetically. Instead, we take a different approach, and propose a 3D human pose estimation algorithm that only requires relative estimates of depth at training time. Such training signal, although noisy, can be easily collected from crowd annotators, and is of sufficient quality for enabling successful training and evaluation of 3D pose algorithms. Our results are competitive with fully supervised regression based approaches on the Human3.6M dataset, despite using significantly weaker training data. Our proposed algorithm opens the door to using existing widespread 2D datasets for 3D pose estimation by allowing fine-tuning with noisy relative constraints, resulting in more accurate 3D poses.

研究动机与目标

  • 为解决真实世界中大规模3D人体姿态数据集稀缺的问题,该问题限制了3D姿态估计模型的训练与评估。
  • 探究相对深度注释——简单、稀疏且可通过众包完成标注——是否可作为全3D监督的可行替代方案,用于训练3D姿态估计器。
  • 证明通过相对深度约束的弱监督可实现在标准基准上的性能与全监督方法相当。
  • 发布一个新的相对关节深度注释数据集,用于训练与评估,以推动未来在弱监督3D姿态估计方向的研究。

提出的方法

  • 该方法采用基于提升的范式,以2D关键点检测结果作为输入,回归得到3D姿态,训练过程中无需全3D真实值。
  • 提出一种新颖的损失函数,强制模型学习成对关节之间的相对深度关系,即判断哪个关节更靠近相机。
  • 相对深度监督通过众包标注获取,标注者仅需判断两个关节中哪一个更接近相机,从而提供一种弱但有效的监督信号。
  • 模型通过端到端方式训练,结合2D关键点监督与相对深度约束,后者虽稀疏且含噪声,但足以支持模型学习。
  • 该方法在Human3.6M和LSP数据集上进行评估,并通过额外的相对深度注释进行微调,以提升泛化能力。
  • 实验表明,该方法对噪声标注具有鲁棒性,即使在模拟噪声条件下仍能保持强性能。

实验结果

研究问题

  • RQ1能否有效利用众包标注获取的相对深度注释来训练3D人体姿态估计模型?
  • RQ2使用相对深度监督训练的3D姿态估计器在标准基准上的性能与全监督基线相比如何?
  • RQ3通过相对深度的弱监督是否能提升在训练数据中未见的多样化姿态与视角下的泛化能力?
  • RQ4是否可能仅使用2D关键点输入与相对深度约束,无需3D真实值,即可实现具有竞争力的3D姿态估计性能?

主要发现

  • 仅使用相对深度监督,该方法在Human3.6M数据集上(协议#2)实现了48.5毫米的平均误差,性能与全监督方法相当。
  • 在LSP数据集上通过额外相对深度注释进行微调后,相对标注误差降低至24.1%,优于全监督基线。
  • 仅在LSP数据集上从零开始训练相对深度模型,测试误差为27.1%,优于该数据集上的全监督基线。
  • 模型在训练数据中未见的罕见姿态与视角上泛化良好,尤其在LSP上微调后,定性结果表明其表现优异。
  • 对相对深度对施加模拟噪声对性能影响极小,表明对真实世界标注噪声具有鲁棒性。
  • 该方法通过仅添加稀疏且易获取的相对深度注释,使现有2D数据集可用于3D姿态估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。