[论文解读] Graph-PCNN: Two Stage Human Pose Estimation with Graph Pose Refinement
Graph-PCNN 提出了一种两阶段、与模型无关的自顶向下人体姿态估计框架,通过将粗略提议与精细化修正阶段解耦,提升了关键点定位的准确性。它引入了基于热力图回归的引导点,以及一种基于图卷积建模关键点间关系的图姿态精炼模块,在 COCO test-dev 上达到 76.8% 的 AP,创下新的 SOTA 记录。
Recently, most of the state-of-the-art human pose estimation methods are based on heatmap regression. The final coordinates of keypoints are obtained by decoding heatmap directly. In this paper, we aim to find a better approach to get more accurate localization results. We mainly put forward two suggestions for improvement: 1) different features and methods should be applied for rough and accurate localization, 2) relationship between keypoints should be considered. Specifically, we propose a two-stage graph-based and model-agnostic framework, called Graph-PCNN, with a localization subnet and a graph pose refinement module added onto the original heatmap regression network. In the first stage, heatmap regression network is applied to obtain a rough localization result, and a set of proposal keypoints, called guided points, are sampled. In the second stage, for each guided point, different visual feature is extracted by the localization subnet. The relationship between guided points is explored by the graph pose refinement module to get more accurate localization results. Experiments show that Graph-PCNN can be used in various backbones to boost the performance by a large margin. Without bells and whistles, our best model can achieve a new state-of-the-art 76.8% AP on COCO test-dev split.
研究动机与目标
- 通过分离粗略提议与精细化修正阶段,提升自顶向下人体姿态估计中的关键点定位准确性。
- 利用基于图的模块建模关键点间关系,以纠正误判并提升空间一致性。
- 设计一种与模型无关的框架,无需修改网络架构即可增强现有的基于热力图的姿态估计器。
- 在 COCO 基准上实现 SOTA 性能,且仅引入极少的额外计算开销。
提出的方法
- 该方法采用两阶段流程:首先,热力图回归网络生成初始关键点提议,从中基于热力图峰值采样引导点。
- 在第二阶段,定位子网络在每个引导点周围提取实例特定特征,以实现坐标的精确修正。
- 引入图姿态精炼(GPR)模块,利用图卷积网络建模引导点之间的关系,强化姿态的结构一致性。
- GPR 模块通过可学习的消息传递机制聚合邻近关键点的特征,借助关系推理提升定位准确性。
- 该框架兼容多种主干网络(如 HRNet、DarkNet),可作为插件无缝集成到现有姿态估计模型中。
- 最终坐标通过可微分的精炼头进行优化,损失函数采用积分损失以实现关键点回归。
实验结果
研究问题
- RQ1是否可以通过将提议与修正阶段分离的两阶段方法,提升自顶向下姿态估计中的关键点定位准确性?
- RQ2通过基于图的模块建模关键点间关系,在纠正关键点误定位方面有多大的有效性?
- RQ3能否设计一种与模型无关的框架,在不改变网络架构的前提下,提升多种主干网络的性能?
- RQ4通过图卷积实现的关系推理是否能在 COCO 等标准基准上带来稳定且一致的性能提升?
主要发现
- Graph-PCNN 在 COCO test-dev 分割上达到 76.8% 的 AP,创下新的 SOTA 记录。
- 在使用 HR48 主干网络且输入尺寸为 384x288 的设置下,Graph-PCNN 相较基线 HR48 模型提升 +1.3% AP(从 75.5% 提升至 76.8%)。
- 在相同主干网络与输入尺寸下,该方法优于其他 SOTA 方法,包括 UDP(76.5%)、DARK(76.2%)和 PoseFix(76.7%)。
- 图姿态精炼模块对性能提升贡献显著,尤其在处理遮挡与复杂姿态时表现优异。
- Graph-PCNN 在性能上与 PoseFix 竞争,但仅使用单个 R50 conv5 阶段作为精炼分支,无需额外的 R50 网络。
- 与模型无关的设计使其能无缝集成到多种主干网络中,展现出广泛的适用性与一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。