Skip to main content
QUICK REVIEW

[论文解读] Exploring Severe Occlusion: Multi-Person 3D Pose Estimation with Gated Convolution

Renshu Gu, Gaoang Wang|arXiv (Cornell University)|Oct 31, 2020
Human Pose and Action Recognition参考文献 35被引用 4
一句话总结

该论文提出了一种时序门控卷积网络,用于在严重遮挡条件下进行多人3D人体姿态估计,利用了新构建的移动摄像头数据集(MMHuman)中的动作捕捉标注数据。该方法通过门控卷积恢复缺失的3D关节点,并通过整合时序一致性和3D到2D反投影技术实现全局轨迹估计,从而在遮挡场景下显著提升精度,优于当前最优方法。

ABSTRACT

3D human pose estimation (HPE) is crucial in many fields, such as human behavior analysis, augmented reality/virtual reality (AR/VR) applications, and self-driving industry. Videos that contain multiple potentially occluded people captured from freely moving monocular cameras are very common in real-world scenarios, while 3D HPE for such scenarios is quite challenging, partially because there is a lack of such data with accurate 3D ground truth labels in existing datasets. In this paper, we propose a temporal regression network with a gated convolution module to transform 2D joints to 3D and recover the missing occluded joints in the meantime. A simple yet effective localization approach is further conducted to transform the normalized pose to the global trajectory. To verify the effectiveness of our approach, we also collect a new moving camera multi-human (MMHuman) dataset that includes multiple people with heavy occlusion captured by moving cameras. The 3D ground truth joints are provided by accurate motion capture (MoCap) system. From the experiments on static-camera based Human3.6M data and our own collected moving-camera based data, we show that our proposed method outperforms most state-of-the-art 2D-to-3D pose estimation methods, especially for the scenarios with heavy occlusions.

研究动机与目标

  • 解决缺乏真实世界、移动摄像头、多人3D姿态数据集且具有精确真实值的问题,尤其是在严重遮挡情况下。
  • 开发一种鲁棒的3D姿态估计方法,能够恢复因严重自遮挡或人与人之间遮挡而缺失的关节点。
  • 提升在挑战性真实世界视频序列中的泛化能力和性能,这些序列超出了静态摄像头基准测试的范围。
  • 提出一种全局轨迹估计方法,利用时序连续性和3D到2D反投影技术,实现在相机坐标系中的姿态定位。
  • 提供一个新的基准数据集(MMHuman),以支持未来在动态相机条件下对遮挡鲁棒的3D人体姿态估计研究。

提出的方法

  • 提出一种带有门控卷积模块的时序回归网络,以建模长距离依赖关系,并从2D姿态序列中恢复缺失的3D关节点。
  • 采用相对于根关节点的归一化3D姿态表示,随后通过3D到2D反投影和时序一致性实现全局轨迹恢复。
  • 应用受图像修复启发的门控卷积,选择性地关注可见关节点,并基于上下文重建被遮挡的关节点。
  • 在真实世界遮挡序列和合成数据的组合上进行模型训练,以提升对遮挡模式的鲁棒性。
  • 采用两阶段流程:首先通过OpenPose进行2D关节点检测并输出置信度分数,随后使用门控时序网络进行2D到3D提升。
  • 引入一种新型损失函数,结合关节点级L2损失与时序平滑正则化,以增强帧间姿态的一致性。

实验结果

研究问题

  • RQ1时序门控卷积网络能否在严重遮挡条件下有效从2D关节点恢复3D姿态?
  • RQ2在存在严重人与人之间遮挡和自遮挡的情况下,所提出方法与当前最优2D到3D提升模型相比,其精度如何?
  • RQ3全局轨迹估计方法在移动摄像头场景中在多大程度上提升了定位精度?
  • RQ4当在包含复杂遮挡的新真实世界数据集上微调时,该模型的泛化能力如何?
  • RQ5所提出方法能否在新收集的、具有移动摄像头和密集遮挡的挑战性数据集(MMHuman)上超越现有方法?

主要发现

  • 在Human3.6M数据集上,所提方法在50%遮挡条件下的3D姿态误差为43.8 mm,优于VideoPose3D(53.2 mm)及其他SOTA方法。
  • 在新构建的MMHuman数据集上,所提方法平均误差为78.3 mm,显著优于Hossain等人(118.5 mm)、Pavllo等人(84.2 mm)和Lin等人(114.9 mm)。
  • 定性结果表明,即使在全身遮挡期间,所提方法仍能保持自然且一致的姿态估计,而VideoPose3D则产生不自然的肢体构型。
  • 该方法对遮挡表现出强鲁棒性,在最具挑战性的序列(如'Kungfu'和'PullUp')中,误差相对VideoPose3D降低了12.5%。
  • 全局轨迹估计方法在无需额外监督的情况下实现了准确的相机坐标系定位,优于VideoPose3D在遮挡场景下的独立轨迹网络。
  • 该模型在未见过的MMHuman数据集动作上无需微调即可实现良好泛化,表明其对真实世界遮挡模式具有强大的零样本泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。