[论文解读] Generative Partition Networks for Multi-Person Pose Estimation
本文提出生成式分割网络(GPN),一种新颖的一次性多人员姿态估计方法,通过在嵌入空间中使用生成模型联合检测人员并分割关键点。通过结合密集回归以实现高效的关节分割,以及利用全局亲和力线索的局部贪婪推理,GPN 在 MPII、PASCAL-Person-Part 和 WAF 基准上实现了最先进精度,且推理复杂度较低。
This paper proposes a new Generative Partition Network (GPN) to address the challenging multi-person pose estimation problem. Different from existing models that are either completely top-down or bottom-up, the proposed GPN introduces a novel strategy--it generates partitions for multiple persons from their global joint candidates and infers instance-specific joint configurations simultaneously. The GPN is favorably featured by low complexity and high accuracy of joint detection and re-organization. In particular, GPN designs a generative model that performs one feed-forward pass to efficiently generate robust person detections with joint partitions, relying on dense regressions from global joint candidates in an embedding space parameterized by centroids of persons. In addition, GPN formulates the inference procedure for joint configurations of human poses as a graph partition problem, and conducts local optimization for each person detection with reliable global affinity cues, leading to complexity reduction and performance improvement. GPN is implemented with the Hourglass architecture as the backbone network to simultaneously learn joint detector and dense regressor. Extensive experiments on benchmarks MPII Human Pose Multi-Person, extended PASCAL-Person-Part, and WAF, show the efficiency of GPN with new state-of-the-art performance.
研究动机与目标
- 解决自顶向下与自底向上方法在多人员姿态估计中的局限性,如高复杂度和误差传播问题。
- 克服自顶向下方法因顺序单人推理导致的低效性,以及自底向上方法关节分割的高计算成本。
- 开发一种统一框架,通过单次前向传播同时检测人员并分割关键点,以提升效率与精度。
- 通过利用鲁棒的人员检测和全局亲和力线索,缩小图分割的搜索空间。
- 通过生成式分割机制和单人姿态估计的精炼,提升对遮挡、重叠和姿态变化的鲁棒性。
提出的方法
- 提出一种生成式分割模型,通过参数化为人员质心的嵌入空间中的密集回归,从全局关节候选中推断人员检测与关键点分割。
- 采用多阶段 Hourglass 网络主干,联合学习关键点检测与用于分割的密集回归。
- 将局部推理形式化为对每个人员检测的贪婪优化,利用嵌入空间中的全局亲和力线索以提高关键点关联的准确性。
- 引入一个精炼步骤,使用单人姿态估计器对每个检测到的人员实例内的关键点位置进行优化。
- 采用置信图精炼机制,通过网络多阶段迭代校正关键点检测与分割中的错误。
- 使用多任务损失端到端训练模型,损失函数包含关键点检测、部件亲和场回归和分割置信度监督。
实验结果
研究问题
- RQ1统一的一次性框架是否能通过结合自顶向下与自底向上方法的优势,在多人员姿态估计中超越现有方法?
- RQ2生成式分割机制在保持高精度的关键点检测与关联的同时,是否能有效降低计算复杂度?
- RQ3与全局图分割或简单自顶向下分配相比,结合全局亲和力线索的局部贪婪推理在多大程度上提升了姿态估计的鲁棒性?
- RQ4生成式分割模型在预测图像中人员数量方面的表现如何?与真实值相比有多准确?
- RQ5多阶段精炼与单人姿态精炼对复杂基准上最终性能的贡献分别是什么?
主要发现
- GPN 在 MPII 多人员姿态估计基准上实现了 79.0% AP 的新 SOTA 性能,优于先前方法。
- 完整 GPN 模型的关节分割推理时间仅为 1.9ms,相比传统方法展现出极高的效率。
- 消融实验表明,若移除局部贪婪推理(GPN-w/o-LGI),性能下降至 77.8% AP,证实其通过全局亲和力线索处理误报的重要性。
- 生成式分割模型预测人员数量的均方误差仅为 0.203,表明其在人数估计方面具有极高精度。
- 多阶段设计实现了性能的单调提升,从第一阶段到第八阶段 AP 提升了 23.4%,表明各阶段间具有有效的误差校正能力。
- 即使不使用精炼或多尺度测试,GPN-Vanilla 变体仍达到 74.8% AP,证明了所提框架的鲁棒性与稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。