Skip to main content
QUICK REVIEW

[论文解读] VoxelPose: Towards Multi-Camera 3D Human Pose Estimation in Wild Environment

Hanyue Tu, Chunyu Wang|arXiv (Cornell University)|Apr 13, 2020
Human Pose and Action Recognition参考文献 41被引用 12
一句话总结

VoxelPose 提出了一种新颖的3D多人姿态估计框架,通过将多视角2D热力图聚合到3D体素特征体素中,直接在3D空间中运行,避免了易出错的2D对应匹配。它使用长方体提议网络(CPN)进行粗粒度3D人体定位,使用姿态回归网络(PRN)进行精细的3D姿态估计,在Campus和Shelf数据集上实现了最先进性能,并显著提升了对遮挡的鲁棒性。

ABSTRACT

We present an approach to estimate 3D poses of multiple people from multiple camera views. In contrast to the previous efforts which require to establish cross-view correspondence based on noisy and incomplete 2D pose estimations, we present an end-to-end solution which directly operates in the $3$D space, therefore avoids making incorrect decisions in the 2D space. To achieve this goal, the features in all camera views are warped and aggregated in a common 3D space, and fed into Cuboid Proposal Network (CPN) to coarsely localize all people. Then we propose Pose Regression Network (PRN) to estimate a detailed 3D pose for each proposal. The approach is robust to occlusion which occurs frequently in practice. Without bells and whistles, it outperforms the state-of-the-arts on the public datasets. Code will be released at https://github.com/microsoft/multiperson-pose-estimation-pytorch.

研究动机与目标

  • 为解决在复杂环境中2D姿态估计不准确和不完整的问题,尤其是在遮挡情况下的问题。
  • 通过直接在3D空间中操作,消除对复杂2D到3D对应匹配的依赖。
  • 通过在多台相机间使用统一的3D特征表示,提升多人3D姿态估计的鲁棒性和准确性。
  • 实现对多样化相机配置的泛化能力,减少对精确2D关键点标注的依赖。

提出的方法

  • 该方法首先使用基于CNN的2D姿态估计器,为所有相机视角估计2D热力图表示。
  • 然后将这些2D热力图投影并扭曲到统一的3D体素空间中,形成全面的3D特征体素,从而增强完整性并减少噪声。
  • 在3D特征体素上应用长方体提议网络(CPN),为场景中所有人生成粗粒度的3D长方体提议。
  • 针对每个提议,提取更精细的3D特征体素,并输入到姿态回归网络(PRN)中,以回归出详细的3D关节点坐标。
  • CPN和PRN通过3D卷积层联合训练,实现端到端学习,无需显式关联2D关键点。
  • 通过3D空间一致性隐式处理视图内和视图间的关键点关联,减少对后处理聚类的依赖。

实验结果

研究问题

  • RQ1通过避免2D对应匹配,能否使3D人体姿态估计对遮挡更具鲁棒性?
  • RQ2由多视角2D热力图构建的3D体素特征体素,能否提升估计的准确性和完整性?
  • RQ3在真实场景中,使用3D卷积网络进行直接3D预测,是否优于两阶段的2D到3D流水线?
  • RQ4在合成热力图上训练的模型,能否在不微调的情况下泛化到真实世界数据?

主要发现

  • 在Campus数据集上,VoxelPose实现了96.7%的PCP3D准确率,相比之前最先进方法的96.3%有所提升。
  • 在Shelf数据集上,其PCP3D准确率达到97.0%,优于之前最佳方法(96.9%),且显著减少了误报。
  • 该方法在Human3.6M单人基准测试中表现出色,实现了19 mm的MPJPE,性能相当。
  • 该方法对合成热力图具有良好的泛化能力,使用合成数据训练的模型性能接近使用真实图像训练的模型。
  • 通过依赖3D空间一致性而非2D检测质量,该方法减少了因2D关键点标注不准确导致的误差。
  • 在单张Titan X GPU上,推理时间约为300ms,通过稀疏3D卷积可进一步加速。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。