Skip to main content
QUICK REVIEW

[论文解读] RePose: Learning Deep Kinematic Priors for Fast Human Pose Estimation

Hossam Isack, Christian Haene|arXiv (Cornell University)|Feb 10, 2020
Human Pose and Action Recognition参考文献 24被引用 9
一句话总结

RePose 通过在低分辨率下采用分层的、从粗到精的特征更新机制,嵌入可学习的运动学先验,提出了一种轻量化、高效的深度学习模型,用于单图人体姿态估计。该方法在 LSP 上达到最先进精度,在 MPII 上取得具有竞争力的结果,仅使用 4.0M 参数和 13.5 GFLOPs,优于未使用蒸馏或压缩技术的更大模型。

ABSTRACT

We propose a novel efficient and lightweight model for human pose estimation from a single image. Our model is designed to achieve competitive results at a fraction of the number of parameters and computational cost of various state-of-the-art methods. To this end, we explicitly incorporate part-based structural and geometric priors in a hierarchical prediction framework. At the coarsest resolution, and in a manner similar to classical part-based approaches, we leverage the kinematic structure of the human body to propagate convolutional feature updates between the keypoints or body parts. Unlike classical approaches, we adopt end-to-end training to learn this geometric prior through feature updates from data. We then propagate the feature representation at the coarsest resolution up the hierarchy to refine the predicted pose in a coarse-to-fine fashion. The final network effectively models the geometric prior and intuition within a lightweight deep neural network, yielding state-of-the-art results for a model of this size on two standard datasets, Leeds Sports Pose and MPII Human Pose.

研究动机与目标

  • 开发一种轻量化人体姿态估计模型,在参数量和计算成本显著减少的情况下仍保持高精度。
  • 以可微分、端到端可训练的方式,将人体结构和几何先验嵌入深度神经网络。
  • 通过在网络架构中直接编码运动学结构,避免使用如 MAP 估计或信念传播等昂贵的推理步骤。
  • 通过多尺度特征更新机制,实现高效、分层的姿态预测优化。
  • 在标准基准(LSP、MPII)上实现最先进性能,且模型规模显著小于以往最先进方法。

提出的方法

  • 该模型采用从粗到精的分层优化策略,在低分辨率特征图(16×16)上应用运动学特征更新,以传播空间一致的预测结果。
  • 运动学特征更新模块按预设的人体解剖顺序(如从骨盆向外)更新关键点特征,使用可学习权重融合旧特征与新特征。
  • 该更新机制被实现为轻量化、可微分的模块,无需使用如环状信念传播等近似推理算法,即可保持几何一致性。
  • 网络端到端训练,使模型能够从数据中学习关节位置和相对构型的复杂非高斯先验。
  • 特征表示通过特征金字塔向上传播,以在更高分辨率上优化预测,最终在最细尺度生成热力图预测。
  • 架构设计通过将更新机制限制在粗分辨率,同时保持高精度,从而最小化参数量和 FLOPs。

实验结果

研究问题

  • RQ1深度神经网络是否能在不依赖显式图模型或高成本推理步骤的情况下,学习复杂的人体姿态几何与结构先验?
  • RQ2在轻量化、可微分模块中编码人体运动学结构,是否能提升精度,同时减少模型大小和推理成本?
  • RQ3特征更新顺序(如从中心向四肢或从头部向脚部)如何影响姿态估计性能?
  • RQ4仅使用 400 万个参数的模型是否能在不使用蒸馏或压缩技术的情况下,于 LSP 上实现最先进性能,并在 MPII 上取得具有竞争力的结果?
  • RQ5在轻量化姿态估计框架中,输入分辨率、热力图方差和计算成本之间的最优权衡是什么?

主要发现

  • RePose 在 LSP 数据集上达到 91.66% 的准确率,在 MPII 上达到 90.29%,仅使用 4.0 百万个参数和 13.5 GFLOPs,创下该规模模型的新 SOTA 记录。
  • 在特征更新模块中使用可学习混合权重,相比简单相加提升 0.53%,相比替换操作提升 1.37%,且参数增加极少。
  • 按解剖顺序(从骨盆向外)的运动学更新优于自上而下的顺序,在 LSP 上提升 0.42%,在 MPII 上提升 0.70%,凸显了解剖序列的重要性。
  • 将输入分辨率从 128×128 提升至 256×256,使 MPII 准确率提升 0.55%,但 FLOPs 增加了 3.7 倍,表明存在显著的计算-精度权衡。
  • 堆叠多个 RePose 阶段使 LSP 准确率提升至 92.99%,MPII 提升至 91.45%,但参数量和 FLOPs 均翻倍。
  • 从拼接更新后特征中联合预测热力图,使 LSP 性能下降 0.45%,MPII 下降 0.35%,表明对每次更新独立预测更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。