Skip to main content
QUICK REVIEW

[论文解读] Faster VoxelPose: Real-time 3D Human Pose Estimation by Orthographic Projection

Hang Ye, Wentao Zhu|arXiv (Cornell University)|Jul 22, 2022
Human Pose and Action Recognition被引用 5
一句话总结

Faster VoxelPose 提出了一种通过将3D特征体投影到2D正交平面(xy、xz、yz)实现实时3D人体姿态估计的方法,从而使用高效的2D-CNN替代计算成本高昂的3D-CNN进行关节点坐标估计。该方法在保持最先进精度的同时,相比VoxelPose实现了约10倍的速度提升,利用3D人体检测器和自适应融合机制解决了不同投影之间存在的模糊性和不一致性问题。

ABSTRACT

While the voxel-based methods have achieved promising results for multi-person 3D pose estimation from multi-cameras, they suffer from heavy computation burdens, especially for large scenes. We present Faster VoxelPose to address the challenge by re-projecting the feature volume to the three two-dimensional coordinate planes and estimating X, Y, Z coordinates from them separately. To that end, we first localize each person by a 3D bounding box by estimating a 2D box and its height based on the volume features projected to the xy-plane and z-axis, respectively. Then for each person, we estimate partial joint coordinates from the three coordinate planes separately which are then fused to obtain the final 3D pose. The method is free from costly 3D-CNNs and improves the speed of VoxelPose by ten times and meanwhile achieves competitive accuracy as the state-of-the-art methods, proving its potential in real-time applications.

研究动机与目标

  • 解决基于3D-CNN的体素方法在多视角3D人体姿态估计中计算成本高的问题,特别是在大规模场景中的应用。
  • 通过正交特征重投影,用高效的2D-CNN替代昂贵的3D卷积,实现实时推理。
  • 利用学习的3D人体检测网络(HDN)与紧密包围框,减少重叠人体在2D投影中的模糊性。
  • 通过检测到的3D包围框对特征体进行掩码处理,提升关节点定位精度。
  • 开发一种置信度感知的融合网络,以解决不同正交平面上预测结果的不一致性。

提出的方法

  • 通过正交投影将融合后的3D特征体重新投影到三个2D坐标平面(xy、xz、yz),以支持2D-CNN处理。
  • 使用人体检测网络(HDN)在xy平面上通过2D边界框定位每个人,并利用z轴列特征上的1D-CNN估计高度。
  • 对检测到的3D包围框内的人体特定3D特征体应用特征掩码,减少其他人体的干扰。
  • 使用专用的2D-CNN从每个2D投影平面上估计部分3D坐标(X、Y、Z),每个坐标产生两个估计值。
  • 通过可学习的加权融合网络将双平面预测结果进行融合,分配置信度权重以减少不一致性。
  • 通过可调节的体素粒度平衡速度与精度,计算复杂度呈二次方而非三次方增长。

实验结果

研究问题

  • RQ1通过正交投影用2D-CNN替代3D-CNN,能否在不牺牲精度的前提下显著加速3D人体姿态估计?
  • RQ2在大规模场景中,如何在关节点定位过程中消除2D投影中重叠人体带来的模糊性?
  • RQ3能否通过解耦地面平面定位与高度估计的3D人体检测器,提升特征掩码与姿态估计的精度?
  • RQ4如何有效融合多个2D投影中的不一致预测,以生成可靠的3D关节点坐标?
  • RQ5该方法在摄像头数量和人数持续增加的大规模、拥挤场景中,其可扩展性如何?

主要发现

  • Faster VoxelPose 在标准基准上相比VoxelPose实现了10倍的速度提升,同时保持了具有竞争力的精度,在CMU Panoptic数据集上MPJPE达到18.26mm。
  • 消融实验证明,特征掩码将AP50从96.75%提升至98.08%,证实其在减少人与人之间干扰中的关键作用。
  • 自适应加权融合将MPJPE从均值融合的20.11mm降低至18.26mm,证明了基于置信度聚合的有效性。
  • 使用更粗的体素(32×32×32)使MACs减少75%(从8.67G降至2.17G),MPJPE仅增加2.1mm,实现了速度与精度的灵活权衡。
  • 当场景从8m×8m扩展到16m×16m并增加至12台摄像头时,推理时间仅增加28.8%,展现出优于先前方法的优越可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。