Skip to main content
QUICK REVIEW

[论文解读] TSGCNeXt: Dynamic-Static Multi-Graph Convolution for Efficient Skeleton-Based Action Recognition with Long-term Learning Potential

Dongjingdin Liu, Pengpeng Chen|arXiv (Cornell University)|Apr 23, 2023
Human Pose and Action Recognition被引用 5
一句话总结

TSGCNeXt 提出一种动态-静态多图卷积网络(DS-SMG),用于高效骨架动作识别,通过减少参数量实现在长时序特征学习中的高效性,训练速度提升 55.08%。其在 NTU RGB+D 120 数据集上达到 SOTA 性能,在跨设置和跨受试者基准上分别达到 91.74% 和 90.22% 的准确率,通过 EMA 的多流融合实现。

ABSTRACT

Skeleton-based action recognition has achieved remarkable results in human action recognition with the development of graph convolutional networks (GCNs). However, the recent works tend to construct complex learning mechanisms with redundant training and exist a bottleneck for long time-series. To solve these problems, we propose the Temporal-Spatio Graph ConvNeXt (TSGCNeXt) to explore efficient learning mechanism of long temporal skeleton sequences. Firstly, a new graph learning mechanism with simple structure, Dynamic-Static Separate Multi-graph Convolution (DS-SMG) is proposed to aggregate features of multiple independent topological graphs and avoid the node information being ignored during dynamic convolution. Next, we construct a graph convolution training acceleration mechanism to optimize the back-propagation computing of dynamic graph learning with 55.08\% speed-up. Finally, the TSGCNeXt restructure the overall structure of GCN with three Spatio-temporal learning modules,efficiently modeling long temporal features. In comparison with existing previous methods on large-scale datasets NTU RGB+D 60 and 120, TSGCNeXt outperforms on single-stream networks. In addition, with the ema model introduced into the multi-stream fusion, TSGCNeXt achieves SOTA levels. On the cross-subject and cross-set of the NTU 120, accuracies reach 90.22% and 91.74%.

研究动机与目标

  • 解决因复杂图学习机制导致的长序列骨架动作识别效率低下与参数瓶颈问题。
  • 克服现有基于 GCN 的方法在建模长时序序列时准确率下降与训练速度变慢的问题。
  • 开发一种轻量化、高效的图学习机制,在动态图操作过程中保留节点信息。
  • 优化图卷积的反向传播效率,实现更快训练速度而不损失性能。
  • 通过采用受 ConvNeXt 启发、阶段计算比例可调的架构重构 GCN,实现长期学习潜力。

提出的方法

  • 提出动态-静态分离多图卷积(DS-SMG),将动态与静态拓扑图解耦,以保留节点信息并避免注意力机制带来的复杂性。
  • 使用逐点卷积在 SMG 分支中聚合来自多个独立邻接矩阵的特征,将其视为可学习参数,不依赖注意力机制。
  • 引入一种图卷积训练加速技术,重构反向计算过程,将反向传播时间减少 66%,实现整体 55.08% 的加速。
  • 设计三种核心模块:TSGCNext 模块、时间主干模块(Temporal Stem)和分离时间下采样(DS)模块,专为长序列建模优化。
  • 采用阶段式计算比例调整与可分离下采样策略,提升深层 GCN 架构中的效率与可扩展性。
  • 采用 EMA(指数移动平均)模型与多流融合(关节、骨骼、运动)提升识别准确率,尤其在具有挑战性的基准上表现优异。

实验结果

研究问题

  • RQ1是否一种简单、非注意力机制的图学习方法能在参数更少、训练更快的前提下,优于复杂的注意力驱动机制?
  • RQ2如何优化动态图卷积以在保持计算效率的同时防止节点信息丢失?
  • RQ3通过引入阶段计算比例调整的改进型 ConvNeXt 架构,能在多大程度上提升 GCN 中的长期时序特征学习能力?
  • RQ4是否一种专为图卷积设计的训练加速策略能显著缩短训练时间而不影响模型准确率?
  • RQ5通过 EMA 与优化的流特定计算比例实现的多流融合,是否能在大规模骨架数据集(如 NTU120)上实现 SOTA 性能?

主要发现

  • TSGCNeXt 在 NTU60 跨受试者设置下达到 94.47% 的准确率,超越最佳的 ST-GCN++ 结果。
  • 在 NTU120 上,其在跨设置设置下达到 91.74% 的准确率,在跨受试者设置下达到 90.22%,创下新的 SOTA 基准。
  • 尽管前向传播时间更长,但通过优化图卷积反向传播,模型实现 55.08% 的训练速度提升。
  • DS-SMG 机制在动态图操作过程中有效保留了节点信息,避免了对复杂注意力模块的依赖。
  • 通过 EMA 与优化的阶段计算比例实现的多流融合,在所有数据集上均实现一致的性能提升,包括在 NW-UCLA 上达到 96.55% 的准确率。
  • TSGCNeXt 在长序列上保持了准确率优势,且未出现参数爆炸,展现出强大的长期学习潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。