Skip to main content
QUICK REVIEW

[论文解读] Holistic Planimetric prediction to Local Volumetric prediction for 3D Human Pose Estimation

Gyeongsik Moon, Ju Yong Chang|arXiv (Cornell University)|Jun 15, 2017
Human Pose and Action Recognition参考文献 31被引用 15
一句话总结

本文提出一种从单张深度图进行两阶段3D人体姿态估计的方法,通过整体2D平面预测结合局部3D体素预测,利用3D卷积神经网络在控制计算成本的同时提升精度。该方法在公开数据集上显著优于当前最先进方法,通过在3D占据网格上进行逐体素概率估计实现卓越性能。

ABSTRACT

We propose a novel approach to 3D human pose estimation from a single depth map. Recently, convolutional neural network (CNN) has become a powerful paradigm in computer vision. Many of computer vision tasks have benefited from CNNs, however, the conventional approach to directly regress 3D body joint locations from an image does not yield a noticeably improved performance. In contrast, we formulate the problem as estimating per-voxel likelihood of key body joints from a 3D occupancy grid. We argue that learning a mapping from volumetric input to volumetric output with 3D convolution consistently improves the accuracy when compared to learning a regression from depth map to 3D joint coordinates. We propose a two-stage approach to reduce the computational overhead caused by volumetric representation and 3D convolution: Holistic 2D prediction and Local 3D prediction. In the first stage, Planimetric Network (P-Net) estimates per-pixel likelihood for each body joint in the holistic 2D space. In the second stage, Volumetric Network (V-Net) estimates the per-voxel likelihood of each body joints in the local 3D space around the 2D estimations of the first stage, effectively reducing the computational cost. Our model outperforms existing methods by a large margin in publicly available datasets.

研究动机与目标

  • 解决直接2D到3D坐标回归在3D人体姿态估计中因特征到坐标映射非线性而导致的性能不佳问题。
  • 克服3D卷积与体素表示在3D姿态估计中带来的高计算成本问题。
  • 通过在3D占据网格中建模身体关节的逐体素概率,提升定位精度。
  • 通过将任务解耦为全局2D估计阶段与局部3D优化阶段,降低计算开销。
  • 通过可扩展、高效的架构,实现在单张深度图上准确的3D姿态估计。

提出的方法

  • 将输入深度图表示为3D占据网格,以支持3D卷积处理并实现逐体素概率估计。
  • 使用平面网络(P-Net),一种2D卷积神经网络,预测每个身体关节在整体2D空间中的逐像素概率图。
  • 基于P-Net的2D关节预测结果,生成以该点为中心的3D局部视图(占据网格),以缩小3D搜索空间。
  • 应用体素网络(V-Net),一种3D卷积神经网络,通过在局部3D区域中估计逐体素概率,对预测结果进行精细化调整。
  • 采用逐体素概率监督进行模型训练,为每个关节提供比坐标回归更丰富的监督信号。
  • 利用P-Net的输出约束V-Net的输入,显著降低3D推理的计算成本。

实验结果

研究问题

  • RQ1与直接的2D到3D坐标回归相比,基于3D占据网格的逐体素概率估计是否能显著提升3D人体姿态估计的精度?
  • RQ2两阶段方法——即先进行整体2D预测,再进行局部3D优化——是否能有效降低计算成本,同时保持或提升精度?
  • RQ3初始2D估计质量(P-Net)对最终3D姿态精度的影响如何,特别是在肘部和手部等易被遮挡关节上?
  • RQ4局部3D优化阶段缺乏全局上下文信息,是否在挑战性关节上限制了性能表现?
  • RQ5所提方法是否能在不使用迭代优化的情况下,在标准基准上超越现有SOTA方法?

主要发现

  • 所提方法在ITOP与EVAL数据集上均显著超越现有SOTA方法。
  • 在10 cm规则下,该方法在ITOP数据集上达到87.5%的平均精度(mAP),在EVAL数据集上达到89.1%。
  • 即使不使用迭代优化,该方法每帧推理时间仅为0.28秒,远快于Haque等人[10]的1.7秒/帧。
  • 当V-Net使用真实2D关节位置进行训练与测试时,EVAL与ITOP数据集上肘部与手部的性能分别提升14.7与9.9个百分点,表明P-Net的2D估计是主要瓶颈。
  • 更大的局部感受野(最大达40×40×40)可略微提升性能,但超过32×32×32后性能增益趋于平缓,受限于感受野范围与GPU显存。
  • 在ITOP数据集上的定性结果表明,身体关节(尤其是非遮挡区域)定位准确,但肘部与手部仍存在显著挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。