Skip to main content
QUICK REVIEW

[论文解读] P-CNN: Pose-based CNN Features for Action Recognition

Guilhem Chéron, Ivan Laptev|arXiv (Cornell University)|Jun 11, 2015
Human Pose and Action Recognition参考文献 33被引用 4
一句话总结

该论文提出P-CNN,一种基于姿态的卷积神经网络描述符,通过在视频中追踪人体部位并提取其外观和运动特征,利用CNN对时间维度进行特征聚合。该方法在JHMDB和MPII Cooking数据集上达到最先进性能,尤其在细粒度动作识别方面表现优异,并与密集轨迹特征具有显著互补性。

ABSTRACT

This work targets human action recognition in video. While recent methods typically represent actions by statistics of local video features, here we argue for the importance of a representation derived from human pose. To this end we propose a new Pose-based Convolutional Neural Network descriptor (P-CNN) for action recognition. The descriptor aggregates motion and appearance information along tracks of human body parts. We investigate different schemes of temporal aggregation and experiment with P-CNN features obtained both for automatically estimated and manually annotated human poses. We evaluate our method on the recent and challenging JHMDB and MPII Cooking datasets. For both datasets our method shows consistent improvement over the state of the art.

研究动机与目标

  • 通过利用人体姿态的结构化时空信息,提升细粒度人体动作识别性能。
  • 设计一种鲁棒的基于CNN的描述符,捕捉人体部位级别的运动与外观特征,优于全局视频描述符。
  • 评估P-CNN特征在人工标注和自动估计人体姿态下的有效性。
  • 证明P-CNN与现有方法(如IDT-FV)的互补性,从而提升整体识别准确率。
  • 验证基于姿态的表征对于捕捉细微动作中判别性运动模式至关重要。

提出的方法

  • P-CNN从视频帧中追踪的人体部位周围局部区域提取外观(RGB)和运动(光流)特征。
  • 针对每个身体部位和帧,使用预训练CNN提取深层特征,以保留空间和时间结构。
  • 通过时间维度上的最小值和最大值池化操作实现时间聚合,为每个身体部位生成静态和动态描述符。
  • 对所有身体部位的描述符进行归一化并拼接,形成最终的外观和光流特征。
  • 最终的P-CNN特征向量是所有身体部位及聚合方式下外观和光流描述符的拼接。
  • 该方法通过人工标注(GT)和自动估计的人体姿态进行评估,以检验其鲁棒性。

实验结果

研究问题

  • RQ1与全局视频描述符相比,基于姿态的CNN特征是否能提升动作识别性能,特别是在细粒度动作识别方面?
  • RQ2当使用自动估计的人体姿态而非人工标注姿态时,P-CNN的性能表现如何?
  • RQ3P-CNN特征在多大程度上与现有方法(如IDT-FV)互补,以提升动作识别性能?
  • RQ4在人体部位级别对CNN特征进行时间聚合,是否能增强对细微动作的判别能力?
  • RQ5与先前基于姿态的方法(如HLPF)相比,所提出的P-CNN描述符是否对姿态估计误差更具鲁棒性?

主要发现

  • 在JHMDB-GT数据集上,P-CNN与IDT-FV结合后,平均准确率达到79.5%,超越了此前最先进方法。
  • 在MPII Cooking数据集上,P-CNN与IDT-FV结合后达到71.4%的mAP,超过此前最先进方法的70.5%,并匹配最佳报告结果。
  • P-CNN在MPII Cooking数据集上显著优于HLPF,尤其在使用自动估计姿态时,表现出对姿态估计误差的强鲁棒性。
  • 对于'shoot_gun'、'wave'和'throw'等动作,P-CNN在IDT-FV基础上实现显著提升,某些情况下排名从200多名降至30名以内。
  • 在'kick_ball'动作上,P-CNN性能低于IDT-FV,表明高度动态动作更易由全局运动特征捕捉。
  • 定性分析表明,由于聚焦于身体部位级别的运动与外观,P-CNN在识别局部化、细粒度动作方面表现优异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。