Skip to main content
QUICK REVIEW

[论文解读] Global Context for Convolutional Pose Machines

Daniil Osokin|arXiv (Cornell University)|Jun 10, 2019
Robotic Mechanisms and Dynamics参考文献 29被引用 6
一句话总结

该论文提出一种U型全局上下文模块,以增强卷积姿态机(CPM)的感知感受野,通过整合全局场景上下文提升单人姿态估计性能。该方法在LIP数据集上将准确率提升至87.9% PCKh,推理速度超过160 FPS,相较于基于hourglass的网络在速度上更具优势,同时保持了具有竞争力的准确率。

ABSTRACT

Convolutional Pose Machine is a popular neural network architecture for articulated pose estimation. In this work we explore its empirical receptive field and realize, that it can be enhanced with integration of a global context. To do so U-shaped context module is proposed and compared with the pyramid pooling and atrous spatial pyramid pooling modules, which are often used in semantic segmentation domain. The proposed neural network achieves state-of-the-art accuracy with 87.9% PCKh for single-person pose estimation on the Look Into Person dataset. A smaller version of this network runs more than 160 frames per second while being just 2.9% less accurate. Generalization of the proposed approach is tested on the MPII benchmark and shown, that it faster than hourglass-based networks, while provides similar accuracy. The code is available at https://github.com/opencv/openvino_training_extensions/tree/develop/pytorch_toolkit/human_pose_estimation .

研究动机与目标

  • 通过整合全局上下文,提升基于CPM的姿态估计网络的感知感受野。
  • 通过全局上下文建模,解决在区分左右关键点及多人场景中的歧义性问题。
  • 通过一种新颖的数据增强技术(掩码身体部位)提升对遮挡的鲁棒性。
  • 对比基于CPM的网络与基于hourglass架构的推理效率,尤其在GPU和CPU上的表现。
  • 展示适用于嵌入式和边缘设备部署的实时性能。

提出的方法

  • 提出一种U型上下文模块,通过多尺度池化和跳跃连接聚合全局上下文,增强CPM中的特征表示。
  • 将U型模块集成到CPM架构中,利用全局场景感知能力优化关键点热力图。
  • 采用一种数据增强策略,在训练过程中随机掩码身体部位,以模拟遮挡并提升模型鲁棒性。
  • 使用多尺度测试(尺度[0.75, 1.0, 1.25])和水平翻转,提升泛化能力。
  • 使用NVIDIA性能分析工具对推理性能进行剖析,识别瓶颈,特别是hourglass网络中的1×1卷积层。
  • 在Intel CPU上使用OpenVINO工具包部署模型,验证其实现实时推理能力。

实验结果

研究问题

  • RQ1能否通过全局上下文模块有效增强基于CPM的姿态估计网络的感知感受野?
  • RQ2所提出的U型上下文模块在姿态估计准确率和效率方面,相较于金字塔池化和空洞空间金字塔池化有何表现?
  • RQ3模拟身体部位遮挡的数据增强方法是否能提升模型的泛化能力与对真实世界遮挡的鲁棒性?
  • RQ4为何基于hourglass的网络尽管理论FLOPs更高,却比所提出的基于CPM的网络更慢?
  • RQ5所提出的基于CPM的网络能否在CPU和GPU上实现高准确率的实时推理?

主要发现

  • 所提出的U型上下文模块在LIP数据集上达到87.9% PCKh,优于此前的最先进方法。
  • 该网络的两阶段版本在GPU上推理速度超过160 FPS,仅比完整模型低2.9%的准确率。
  • 在Intel Core i7-6850K CPU上使用OpenVINO实现19.5 FPS,证明其适用于边缘设备部署。
  • 该模型比原始CPM快25%,在速度上优于基于hourglass的网络,同时在MPII数据集上的准确率与之相当或更优。
  • 识别出基于hourglass的网络瓶颈在于1×1卷积层,这些层在GPU上为内存受限且效率低下。
  • 所提出的增强技术显著提升了对被遮挡关键点的性能,尤其在髋部关键点定位任务中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。