Skip to main content
QUICK REVIEW

[论文解读] Learning to Refine Human Pose Estimation

Mihai Fieraru, Anna Khoreva|arXiv (Cornell University)|Apr 21, 2018
Human Pose and Action Recognition参考文献 40被引用 9
一句话总结

本文提出PoseRefiner,一种后处理网络,通过联合建模图像外观与姿态结构来修正常见错误(如关节合并和左右混淆),从而优化人体姿态估计。该方法通过一种新颖的数据增强方案实现误差纠正,在多个基准测试中达到最先进性能,mAP最高提升5.3点,mMOTA最高提升4.9点。

ABSTRACT

Multi-person pose estimation in images and videos is an important yet challenging task with many applications. Despite the large improvements in human pose estimation enabled by the development of convolutional neural networks, there still exist a lot of difficult cases where even the state-of-the-art models fail to correctly localize all body joints. This motivates the need for an additional refinement step that addresses these challenging cases and can be easily applied on top of any existing method. In this work, we introduce a pose refinement network (PoseRefiner) which takes as input both the image and a given pose estimate and learns to directly predict a refined pose by jointly reasoning about the input-output space. In order for the network to learn to refine incorrect body joint predictions, we employ a novel data augmentation scheme for training, where we model "hard" human pose cases. We evaluate our approach on four popular large-scale pose estimation benchmarks such as MPII Single- and Multi-Person Pose Estimation, PoseTrack Pose Estimation, and PoseTrack Pose Tracking, and report systematic improvement over the state of the art.

研究动机与目标

  • 解决多人姿态估计中持续存在的挑战,如关节合并、左右混淆和遮挡,这些问题是当前最先进模型仍难以解决的难题。
  • 开发一种通用的优化框架,可无缝集成到任意现有姿态估计方法之上,无需修改网络结构。
  • 通过显式训练模型纠正常见预测错误,提升在复杂场景(如人物近距离聚集、部分遮挡、罕见姿态)下的性能表现。
  • 实现端到端、前馈式的优化流程,同时利用图像和姿态输入,生成更准确、更一致的关节点位置。

提出的方法

  • 提出一种完全卷积的基于ResNet的网络架构,输入为RGB图像和初始姿态估计结果,输出为优化后姿态。
  • 设计一种新颖的数据增强方案,通过扰动真实姿态来合成具有挑战性的姿态样本,以模拟常见错误(如关节合并、左右互换)。
  • 通过最小化优化预测与真实标注之间的L2损失进行端到端训练,使网络能够通过监督学习掌握误差纠正能力。
  • 在多人场景中对每个个体独立应用优化网络,保持身份一致性,适用于跟踪流水线。
  • 使用同一套网络架构同时支持单人与多人姿态估计及跟踪任务,验证其在不同任务间的泛化能力。
  • 将优化步骤作为后处理模块集成,与任意现有姿态估计器兼容,无需重新训练。

实验结果

研究问题

  • RQ1学习型优化网络能否有效纠正基于深度学习的人体姿态估计中的常见失败模式,如关节合并与左右混淆?
  • RQ2一种显式建模困难姿态样本的数据增强方案,是否能提升优化网络的泛化能力与鲁棒性?
  • RQ3后处理优化模块在多样化基准与任务上,能在多大程度上提升最先进模型的性能?
  • RQ4优化网络能否恢复未被原始模型预测的缺失关节(如鼻尖),并因此提升整体性能?
  • RQ5该优化框架是否具备跨不同姿态估计与跟踪方法的通用性?在多人场景中是否能保持身份一致性?

主要发现

  • 在MPII多人姿态估计基准上,PoseRefiner将最佳报告mAP从71.9提升至73.8,提升+1.9 mAP。
  • 在PoseTrack多人姿态跟踪基准上,该方法将mMOTA从48.6提升至53.5(应用于ML_Lab基线),提升+4.9 mMOTA。
  • 对于ArtTrack(原始模型未预测鼻尖关节),优化过程成功恢复了鼻尖,使mAP从68.6提升至69.7,提升+1.1 mAP(包含鼻尖时)。
  • 该方法在所有评估的基线模型上均实现性能提升,包括BUTD和Detect-and-Track等顶尖方法,mAP最高提升+5.3点,mMOTA最高提升+5.3点。
  • 在跟踪性能方面取得显著改进,mMOTA在不同基线上提升2.4至3.9点,证明其在时序一致性方面的有效性。
  • 定性结果表明,该网络能有效解决关节混淆与合并问题,尤其在人群密集或遮挡严重的场景中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。