Skip to main content
QUICK REVIEW

[论文解读] HDNet: Human Depth Estimation for Multi-Person Camera-Space Localization

Jiahao Lin, Gim Hee Lee|arXiv (Cornell University)|Jul 17, 2020
Human Pose and Action Recognition参考文献 30被引用 6
一句话总结

HDNet 是一种端到端的深度学习框架,通过联合学习2D姿态估计与深度回归,实现多个人体3D姿态估计中绝对根关节深度在相机坐标系下的估计。它采用热力图引导的特征池化、基于骨骼的图神经网络(GNN)进行关节间特征传播,并将深度估计建模为带有软-argmax的分类任务以提升精度,在Human3.6M和MuPoTS-3D数据集上多个指标上优于先前的SOTA方法。

ABSTRACT

Current works on multi-person 3D pose estimation mainly focus on the estimation of the 3D joint locations relative to the root joint and ignore the absolute locations of each pose. In this paper, we propose the Human Depth Estimation Network (HDNet), an end-to-end framework for absolute root joint localization in the camera coordinate space. Our HDNet first estimates the 2D human pose with heatmaps of the joints. These estimated heatmaps serve as attention masks for pooling features from image regions corresponding to the target person. A skeleton-based Graph Neural Network (GNN) is utilized to propagate features among joints. We formulate the target depth regression as a bin index estimation problem, which can be transformed with a soft-argmax operation from the classification output of our HDNet. We evaluate our HDNet on the root joint localization and root-relative 3D pose estimation tasks with two benchmark datasets, i.e., Human3.6M and MuPoTS-3D. The experimental results show that we outperform the previous state-of-the-art consistently under multiple evaluation metrics. Our source code is available at: https://github.com/jiahaoLjh/HumanDepth.

研究动机与目标

  • 为解决多个人体3D姿态估计中缺乏绝对3D定位的问题,该方法通常仅关注根关节相对位置。
  • 通过利用人体身体先验和关节热力图作为注意力掩码,提升单目图像中根关节深度估计的准确性。
  • 开发一种端到端框架,联合优化2D姿态估计与绝对深度回归,以提升定位精度和下游3D姿态估计性能。
  • 克服先前方法依赖人体框尺寸进行深度估计的局限性,该类方法对姿态变化和检测器不一致性敏感。

提出的方法

  • HDNet首先使用热力图估计2D人体姿态,随后将这些热力图作为注意力掩码,对每个关节类型的图像特征进行特定池化。
  • 将姿态感知的特征输入基于骨骼的图神经网络(GNN),在身体关节之间传播并优化特征,以增强深度估计。
  • 通过将深度离散化为预定义的分箱,将深度估计建模为分类任务,从而实现更稳定的训练和更好的泛化能力。
  • 网络使用软-argmax操作将分箱分类输出转换为连续的深度预测,提升收敛性和精度。
  • 采用多尺度特征金字塔网络(FPN)提取丰富特征,并为姿态和深度估计分别设置独立分支,以避免特征相关性偏差。
  • 通过联合损失函数(包含2D姿态估计和深度分类损失)进行端到端训练,实现所有组件的联合优化。

实验结果

研究问题

  • RQ1能否在端到端框架中有效结合2D姿态估计与深度回归,以提升绝对3D姿态定位性能?
  • RQ2与全局池化或基于人体框的方法相比,使用关节热力图作为注意力掩码进行特征池化是否能提升深度估计精度?
  • RQ3基于骨骼的GNN是否能有效实现关节间特征的传播与优化,从而提升深度估计性能?
  • RQ4将深度回归建模为分箱分类任务并结合软-argmax,是否比直接回归方法在单目深度估计中更具优势?
  • RQ5改进的根关节定位是否能带来下游根相对3D姿态估计任务性能的提升?

主要发现

  • 在Human3.6M数据集上,HDNet的平均相对百分比误差(MRPE_z)为69.9 mm,优于先前SOTA方法RootNet的108.1 mm,相对提升38.2 mm。
  • 在MuPoTS-3D数据集上,HDNet的25 mm精度平均值(AP₂₅^root)达到39.4%,较RootNet的31.0%提升8.4个百分点。
  • 消融实验表明,与全连接层相比,GNN组件可将误差降低3 mm,证明其在特征传播中的有效性。
  • 移除基于热力图的池化操作后,MRPE_z增加1.9 mm,AP₂₅^root下降13.4%,证实其在选择性特征聚合中的关键作用。
  • 直接回归方法的性能劣于分箱分类方法,MRPE_z高出14.2 mm,验证了分类方法的优势。
  • 改进的根关节定位显著提升了根相对3D姿态估计性能,使平均3DPCK_rel较先前SOTA提升1.2%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。