Skip to main content
QUICK REVIEW

[论文解读] Monocular 3D Human Pose Estimation In The Wild Using Improved CNN Supervision

Dushyant Mehta, Helge Rhodin|arXiv (Cornell University)|Nov 29, 2016
Human Pose and Action Recognition参考文献 74被引用 16
一句话总结

本文提出了一种基于CNN的单目3D人体姿态估计方法,利用2D姿态数据集的迁移学习,并引入了一个新的野外3D姿态数据集MPI-INF-3DHP,该数据集通过无标记动作捕捉系统采集。通过结合改进的CNN监督、域自适应和数据增强,该方法在基准测试中实现了最先进性能,并显著提升了在非受限、真实世界场景中的泛化能力。

ABSTRACT

We propose a CNN-based approach for 3D human body pose estimation from single RGB images that addresses the issue of limited generalizability of models trained solely on the starkly limited publicly available 3D pose data. Using only the existing 3D pose data and 2D pose data, we show state-of-the-art performance on established benchmarks through transfer of learned features, while also generalizing to in-the-wild scenes. We further introduce a new training set for human body pose estimation from monocular images of real humans that has the ground truth captured with a multi-camera marker-less motion capture system. It complements existing corpora with greater diversity in pose, human appearance, clothing, occlusion, and viewpoints, and enables an increased scope of augmentation. We also contribute a new benchmark that covers outdoor and indoor scenes, and demonstrate that our 3D pose dataset shows better in-the-wild performance than existing annotated data, which is further improved in conjunction with transfer learning from 2D pose data. All in all, we argue that the use of transfer learning of representations in tandem with algorithmic and data contributions is crucial for general 3D body pose estimation.

研究动机与目标

  • 解决仅在稀缺且受控的3D姿态数据集上训练的3D姿态估计模型泛化能力有限的问题。
  • 提升在非受限、野外环境中模型的性能,这些环境中的姿态变化、遮挡和多样的外观特征对现有方法构成挑战。
  • 通过引入使用无标记多相机系统采集的新数据集,克服真实世界场景中大规模、多样化且逼真的3D姿态注释缺乏的问题。
  • 证明从2D姿态估计特征进行迁移学习能显著提升真实世界设置下3D姿态估计的准确性和鲁棒性。
  • 开发一种结合网络架构改进、数据增强和多模态监督的方法,以提升模型泛化能力,且无需额外的3D注释。

提出的方法

  • 通过使用预训练的2D姿态估计网络的特征初始化3D姿态网络,实现迁移学习,并通过域自适应微调以对齐跨域特征。
  • 在多个网络层(res4b5和res4b20)引入中间监督,使用预测头预测3D关节点位置、根方向和部件标签。
  • 在最后一层卷积层(res5a)通过2D热力图和部件标签图预测引入辅助监督,以改善特征学习。
  • 提出一种多模态融合策略,结合Human3.6m和MPI-INF-3DHP数据集,对联合训练采用独立的学习率缩放和损失权重调度。
  • 采用带有梯度反转的域自适应模块,将野外2D数据(MPII、LSP)的特征与3D姿态网络对齐,提升对域偏移的鲁棒性。
  • 应用广泛的数据增强,包括背景、椅子和纹理变化,以增强MPI-INF-3DHP数据集中前景和背景的多样性。

实验结果

研究问题

  • RQ1从2D姿态估计网络进行迁移学习是否能提升在非受限、野外场景中3D姿态估计的泛化能力?
  • RQ2所提出的增强数据和多模态训练策略对真实世界序列中模型的鲁棒性和性能有何影响?
  • RQ3与现有数据集相比,使用无标记系统采集的新野外3D姿态数据集在多大程度上提升了模型的泛化能力?
  • RQ4CNN架构中的中间监督和辅助任务是否提升了3D姿态估计的准确性和特征学习?
  • RQ5架构改进、数据多样性与迁移学习的结合,为何能优于单纯的权重随机初始化或仅使用域自适应的方法?

主要发现

  • 所提方法在MPI-INF-3DHP测试集上达到64.7 3DPCK,显著优于仅使用域自适应的41.4 3DPCK。
  • 新引入的MPI-INF-3DHP数据集使模型在现有基准上实现了最先进性能,并在泛化到野外场景方面优于现有数据集。
  • 通过适当的微调,从2D姿态网络进行迁移学习可获得比简单权重初始化或基于域自适应的方法更高的准确性和泛化能力。
  • 多模态训练(Human3.6m + MPI-INF-3DHP)与改进的数据增强相结合,显著提升了模型的鲁棒性和性能。
  • 该方法在受控基准上实现了最先进结果,同时在野外序列中也表现出色,验证了其泛化能力。
  • 中间监督和辅助任务的使用改善了特征学习,从而提升了3D关节点预测的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。