[论文解读] Joint Multi-Person Pose Estimation and Semantic Part Segmentation
本文提出一种联合框架,用于多人姿态估计与语义部件分割,利用深度特征和带新颖部件-关节平滑项的全连接CRF。通过迭代融合姿态与部件预测(姿态引导部件分割,部件优化姿态),本方法在姿态估计上提升10.6%,在分割上提升1.5%,同时通过在检测到的人体框上进行实例级CRF推理,使推理速度比之前工作快40倍。
Human pose estimation and semantic part segmentation are two complementary tasks in computer vision. In this paper, we propose to solve the two tasks jointly for natural multi-person images, in which the estimated pose provides object-level shape prior to regularize part segments while the part-level segments constrain the variation of pose locations. Specifically, we first train two fully convolutional neural networks (FCNs), namely Pose FCN and Part FCN, to provide initial estimation of pose joint potential and semantic part potential. Then, to refine pose joint location, the two types of potentials are fused with a fully-connected conditional random field (FCRF), where a novel segment-joint smoothness term is used to encourage semantic and spatial consistency between parts and joints. To refine part segments, the refined pose and the original part potential are integrated through a Part FCN, where the skeleton feature from pose serves as additional regularization cues for part segments. Finally, to reduce the complexity of the FCRF, we induce human detection boxes and infer the graph inside each box, making the inference forty times faster. Since there's no dataset that contains both part segments and pose labels, we extend the PASCAL VOC part dataset with human pose joints and perform extensive experiments to compare our method against several most recent strategies. We show that on this dataset our algorithm surpasses competing methods by a large margin in both tasks.
研究动机与目标
- 为解决独立姿态估计与部件分割方法在弱外观线索下存在的歧义性与形状上下文缺失问题。
- 利用姿态与部件信息的互补性:姿态提供全局形状先验,部件提供空间一致性。
- 通过利用人体检测框实现局部化、高效推理,降低全图CRF推理的计算成本。
- 通过在PASCAL VOC Part基础上增加14个人体关节标注,构建并发布一个新的基准数据集,以支持联合学习。
- 证明联合优化可同时超越当前最先进方法,在准确率与推理速度上实现双重提升。
提出的方法
- 训练两个全卷积网络(FCNs):姿态FCN用于生成关节得分图与邻接关节图,部件FCN用于生成部件得分图。
- 在全连接CRF中融合三类特征(关节得分、邻接得分、部件得分),引入新颖的部件-关节平滑项,以强制实现空间与语义一致性。
- 利用优化后的姿态关节生成骨架特征,并将其作为额外正则化提示输入第二阶段的部件FCN。
- 采用“自动缩放”策略:使用检测器检测人体实例,对每个实例进行缩放,并在每个边界框内执行CRF推理,以降低复杂度。
- 利用在PASCAL-Person-Part数据集基础上扩展了14个关节标注的数据集进行训练与评估。
- 采用多阶段推理流程:初始FCN预测 → CRF优化 → 带姿态特征的第二阶段FCN,以提升分割性能。
实验结果
研究问题
- RQ1与独立学习相比,姿态估计与语义部件分割的联合优化是否能同时提升两个任务的性能?
- RQ2如何有效利用部件级别的语义一致性来正则化姿态估计,特别是在模糊或遮挡情况下?
- RQ3将姿态作为形状先验是否能提升语义部件分割的准确率与细节,尤其是在低对比度或复杂区域(如四肢)?
- RQ4将CRF推理限制在人体检测框内,是否能显著降低计算成本而不损失精度?
- RQ5所提方法在小尺度与大尺度人体实例上的泛化能力如何?
主要发现
- 与竞争方法相比,本方法在姿态估计上的准确率提升10.6%,在小尺度或遮挡严重等困难情况下的提升尤为显著。
- 联合推理框架有效减少了姿态估计中的定位误差,如纠正错位的肘部与手腕,恢复缺失的额头关节。
- 语义部件分割的mIOU提升1.5%,在手臂与腿部等细粒度区域表现尤为突出,尤其对小尺度实例有明显增益。
- 在PASCAL-Person-Part数据集上,使用ResNet-101模型,本方法达到64.39%的mIOU,较之前最先进方法在小尺度人体实例上提升超过5%。
- 通过实例级CRF推理,推理时间相比全图CRF减少40倍,实现每张图像8秒的推理速度,而DeeperCut需4分钟。
- 可视化结果表明,本方法在弱外观线索区域生成了更连贯、更精细的姿态与部件预测,尤其在复杂或模糊区域表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。