Skip to main content
QUICK REVIEW

[论文解读] Pose Refinement Graph Convolutional Network for Skeleton-based Action Recognition

Shijie Li, Jinhui Yi|arXiv (Cornell University)|Oct 14, 2020
Human Pose and Action Recognition参考文献 54被引用 5
一句话总结

该论文提出了一种姿态优化图卷积网络(PR-GCN),一种高效的人体骨骼动作识别模型,通过并行轻量化架构逐步融合空间与运动特征,对噪声较大的人体姿态估计进行优化。与最先进图卷积网络相比,PR-GCN将参数量减少86%-93%,浮点运算量(FLOPs)减少89%-96%,同时在Kinetics和NTU RGB+D数据集上保持了具有竞争力的准确率,使其特别适用于资源受限的机器人应用。

ABSTRACT

With the advances in capturing 2D or 3D skeleton data, skeleton-based action recognition has received an increasing interest over the last years. As skeleton data is commonly represented by graphs, graph convolutional networks have been proposed for this task. While current graph convolutional networks accurately recognize actions, they are too expensive for robotics applications where limited computational resources are available. In this paper, we therefore propose a highly efficient graph convolutional network that addresses the limitations of previous works. This is achieved by a parallel structure that gradually fuses motion and spatial information and by reducing the temporal resolution as early as possible. Furthermore, we explicitly address the issue that human poses can contain errors. To this end, the network first refines the poses before they are further processed to recognize the action. We therefore call the network Pose Refinement Graph Convolutional Network. Compared to other graph convolutional networks, our network requires 86\%-93\% less parameters and reduces the floating point operations by 89%-96% while achieving a comparable accuracy. It therefore provides a much better trade-off between accuracy, memory footprint and processing time, which makes it suitable for robotics applications.

研究动机与目标

  • 为解决现有图卷积网络(GCNs)在基于骨骼的动作识别中计算成本过高的问题,特别是针对计算资源有限的机器人部署场景。
  • 明确缓解2D/3D骨骼数据中姿态估计误差的影响,而这类误差在以往方法中常被忽略。
  • 设计一种紧凑高效的网络架构,通过新颖的渐进式融合机制,融合空间与时间信息,从而在保持高准确率的同时实现高性能。
  • 与现有基于GCN的方法相比,实现更优的模型效率(参数量、FLOPs)与识别准确率之间的权衡。

提出的方法

  • 网络首先应用姿态优化模块(PRM),利用空间与时间上下文信息,对关节点进行逐关节偏移估计,以校正噪声较大的骨骼数据。
  • 经过优化的姿态数据随后由渐进式融合模块(GFM)处理,该模块包含两条并行分支:位置-流分支用于空间图卷积,运动-流分支用于对运动特征进行时间卷积。
  • GFM通过时间维度逐步融合空间与运动表征,早期降低时间分辨率以最小化计算成本。
  • 通过1D卷积实现时间聚合,整合时序特征并预测动作类别概率。
  • 整个网络采用端到端训练,仅使用动作分类损失,无需额外监督信号用于姿态优化。
  • 架构采用深度可分离卷积与早期时间下采样策略,显著降低浮点运算量与模型大小。

实验结果

研究问题

  • RQ1能否在不牺牲基于骨骼动作识别准确率的前提下,使图卷积网络显著提升效率?
  • RQ2显式优化噪声较大的人体姿态估计是否能提升真实场景下的动作识别性能?
  • RQ3并行渐进式融合空间与运动特征是否在准确率与效率方面优于顺序融合方式?
  • RQ4所提出的架构是否适合在计算资源受限的机器人平台中部署?

主要发现

  • 在使用2D姿态的Kinetics数据集上,PR-GCN实现了33.7%的top-1准确率,与最先进方法2s-AGCN(36.1%)相当,但仅使用其7%的参数量与4%的GFLOPs。
  • 在使用3D姿态的NTU RGB+D数据集上,PR-GCN在X-Sub上达到85.2%的top-1准确率,在X-View上达到91.7%,优于ST-GCN与GFNet,且仅使用0.5M参数与1.7 GFLOPs。
  • 与最先进GCNs相比,PR-GCN将参数量减少86%-93%,浮点运算量减少89%-96%,显著优化了效率-准确率权衡。
  • 消融实验证实,GFM中位置与运动特征的并行融合至关重要,其准确率较顺序融合方式提升2.4%(在同时使用两类特征时)。
  • 姿态优化模块在所有数据集上平均提升准确率1.5%,证明其在极低计算开销下有效缓解了姿态估计误差。
  • 与轻量化基线方法(如EleAtt-GRU与GFNet)相比,PR-GCN在更少参数与更低FLOPs下实现了更高准确率,充分证明其在效率-准确率平衡方面的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。