[论文解读] Explicit Occlusion Reasoning for Multi-person 3D Human Pose Estimation
本文提出HUPOR,一种用于多人3D人体姿态估计的新框架,通过利用可见线索显式推理被遮挡关节点。通过采用深度监督编码器蒸馏(DSED)网络,将可见关节点检测与被遮挡关节点推理解耦,并利用基于骨骼的形状拟合(SSF)方法生成精确的伪遮挡标签,该方法在多个基准测试中实现了最先进性能,显著提升了在严重遮挡情况下的鲁棒性。
Occlusion poses a great threat to monocular multi-person 3D human pose estimation due to large variability in terms of the shape, appearance, and position of occluders. While existing methods try to handle occlusion with pose priors/constraints, data augmentation, or implicit reasoning, they still fail to generalize to unseen poses or occlusion cases and may make large mistakes when multiple people are present. Inspired by the remarkable ability of humans to infer occluded joints from visible cues, we develop a method to explicitly model this process that significantly improves bottom-up multi-person human pose estimation with or without occlusions. First, we split the task into two subtasks: visible keypoints detection and occluded keypoints reasoning, and propose a Deeply Supervised Encoder Distillation (DSED) network to solve the second one. To train our model, we propose a Skeleton-guided human Shape Fitting (SSF) approach to generate pseudo occlusion labels on the existing datasets, enabling explicit occlusion reasoning. Experiments show that explicitly learning from occlusions improves human pose estimation. In addition, exploiting feature-level information of visible joints allows us to reason about occluded joints more accurately. Our method outperforms both the state-of-the-art top-down and bottom-up methods on several benchmarks.
研究动机与目标
- 为解决单目多人3D人体姿态估计中持续存在的遮挡问题,该问题在真实场景中严重降低性能。
- 克服现有方法依赖隐式推理或泛化能力差的姿势先验的局限性,这些先验对未见遮挡模式的泛化能力较差。
- 通过建模人类通过可见关节点和上下文线索推断被遮挡关节点的能力,实现显式遮挡推理。
- 在缺乏每关节点可见性标注的现有数据集中,通过生成准确的伪遮挡标签来克服这一限制,以支持训练。
- 通过集成增强检测与分组鲁棒性的推理模块,同时提升2D和3D人体姿态估计性能。
提出的方法
- 该方法将3D人体姿态估计分为两个阶段:(1) 使用最先进自下而上的检测器进行可见关节点检测;(2) 使用专用模块进行被遮挡关节点推理。
- 提出深度监督编码器蒸馏(DSED)网络,通过利用可见关节点和上下文信息的特征表示,显式推断被遮挡关节点。
- 引入基于骨骼的人体形状拟合(SSF)方法,通过将参数化SMPL模型拟合到图像并使用基于投影的可见性检查,生成精确的伪遮挡标签。
- SSF方法在现有形状拟合基础上进行改进,结合基于2D/3D姿态和图像的拟合,能够检测自遮挡、物体遮挡以及多人之间的相互遮挡。
- 推理模块使用生成的伪遮挡标签进行训练,使网络能够在无需人工标注的情况下学习显式遮挡推理。
- 通过修改推理模块中的深度感知组件,该框架可兼容2D和3D姿态估计。
实验结果
研究问题
- RQ1显式遮挡推理是否能显著提升多人3D人体姿态估计在严重遮挡下的鲁棒性?
- RQ2当缺乏真实可见性标注时,如何为训练生成准确的伪遮挡标签?
- RQ3一个利用可见关节点特征的专用推理模块是否能优于端到端或隐式推理方法?
- RQ4与标准的hourglass或基于Transformer的架构相比,DSED网络在被遮挡关节点预测方面提升了多少?
- RQ5所提方法是否能泛化到2D人体姿态估计任务,并在无深度监督下提升性能?
主要发现
- HUPOR在COCO test-dev 2017基准上达到最先进性能,引入DSED推理模块后,AP从68.4提升至69.5。
- 在3DPW数据集上,该方法将MPJPE从80.0降低至79.1,PA-MPJPE从48.8降低至49.3,表明网格重建精度得到提升。
- SSF方法生成的遮挡标签精度达88.5%,召回率达80.5%,显著优于基线方法如Cylinder(65.3%精度)和HybrIK(80.0%精度)。
- 添加推理模块后,COCO上的2D姿态估计性能最高提升1.7 AP,表明其在3D任务之外也具备良好泛化能力。
- DSED网络至关重要:移除后COCO上的性能下降超过2 AP,证实其在有效特征蒸馏中对遮挡推理的关键作用。
- 该方法显著减少了常见失败案例,如漏检人员、误检额外人员以及遮挡下骨架不完整等问题,如定性对比所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。