Skip to main content
QUICK REVIEW

[论文解读] Vertex Feature Encoding and Hierarchical Temporal Modeling in a Spatial-Temporal Graph Convolutional Network for Action Recognition

Konstantinos Papadopoulos, Enjie Ghorbel|arXiv (Cornell University)|Dec 20, 2019
Human Pose and Action Recognition参考文献 22被引用 21
一句话总结

本论文通过引入两个新型模块,提出了一种紧凑的端到端时空图卷积网络,用于基于骨骼的动作识别:可学习的图顶点特征编码器(GVFE),将原始关节点坐标转换为更具判别性的特征空间;以及空洞分层时间卷积网络(DH-TCN),用于建模短期和长期时间依赖关系。该方法仅使用四个网络块,就在NTU RGB-D数据集上实现了最先进性能,显著少于先前方法,同时减少了参数量、训练时间和内存占用。

ABSTRACT

This paper extends the Spatial-Temporal Graph Convolutional Network (ST-GCN) for skeleton-based action recognition by introducing two novel modules, namely, the Graph Vertex Feature Encoder (GVFE) and the Dilated Hierarchical Temporal Convolutional Network (DH-TCN). On the one hand, the GVFE module learns appropriate vertex features for action recognition by encoding raw skeleton data into a new feature space. On the other hand, the DH-TCN module is capable of capturing both short-term and long-term temporal dependencies using a hierarchical dilated convolutional network. Experiments have been conducted on the challenging NTU RGB-D-60 and NTU RGB-D 120 datasets. The obtained results show that our method competes with state-of-the-art approaches while using a smaller number of layers and parameters; thus reducing the required training time and memory.

研究动机与目标

  • 解决原始骨架特征(如关节点坐标)在动作识别中判别能力有限的问题。
  • 克服标准ST-GCN在仅使用单个时间卷积层时难以建模长期时间依赖关系的局限性。
  • 在不损失性能的前提下,减少基于ST-GCN模型的网络块数量和参数量。
  • 开发一种更高效、可端到端训练的骨架-based动作识别框架。
  • 证明学习到的顶点特征与分层时间建模可显著提升识别准确率,且层数更少。

提出的方法

  • 引入图顶点特征编码器(GVFE),一个可训练模块,将原始3D关节点坐标映射到学习得到的、更具判别性的顶点特征空间,并与ST-GCN端到端联合训练。
  • 提出空洞分层时间卷积网络(DH-TCN),采用分层结构中的堆叠空洞卷积,以捕捉短期与长期时间动态。
  • 用DH-TCN模块替换ST-GCN块中的标准时间卷积,以增强时间建模能力。
  • 构建时空图,其中顶点代表每一帧中的关节点,边代表空间(帧内)和时间(帧间)连接。
  • 使用反向传播端到端优化整个网络,联合学习顶点特征与时间表示。
  • 使用改进的ST-GCN块,结合空间图卷积与DH-TCN进行时间特征学习,随后接全局平均池化与SoftMax分类器。

实验结果

研究问题

  • RQ1与原始关节点坐标相比,端到端学习的顶点特征是否能提升ST-GCN中的动作识别性能?
  • RQ2分层空洞时间卷积网络是否能有效建模骨架序列中的短期与长期时间依赖关系?
  • RQ3在保持或提升准确率的前提下,减少ST-GCN块数量能在多大程度上提升效率?
  • RQ4GVFE与DH-TCN模块在性能提升中各自及联合贡献如何?
  • RQ5所提出的框架是否在更少参数量与更短训练时间下,实现优于最先进ST-GCN变体的准确率?

主要发现

  • 所提方法(GVFE + ST-GCN w/ DH-TCN)在NTU RGB-D 120数据集的跨设置设置下达到74.2%的准确率,较原始ST-GCN提升22.4%,且仅使用四个块。
  • 仅使用四个块,该方法在跨主体与跨设置设置下分别优于原始ST-GCN(分别为45.3%与51.8%),准确率提升超过22个百分点。
  • 消融实验确认GVFE与DH-TCN均贡献显著:GVFE单独使用可将准确率提升至70.9%,DH-TCN单独使用可提升至68.3%,完整模型达到74.2%。
  • 该方法将参数量从原始AS-GCN(10个块)的7,420,696减少至7,370,568(4个块),同时在NTU-120上保持或提升准确率。
  • 在NTU-120数据集(跨设置)上,训练时间相比原始AS-GCN(10个块)减少了24,029秒。
  • 性能提升最显著体现在用DH-TCN替换标准时间卷积时,表明其在建模长程时间依赖关系方面具有显著有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。