Skip to main content
QUICK REVIEW

[论文解读] Dynamic Hypergraph Convolutional Networks for Skeleton-Based Action Recognition

Jinfeng Wei, Yunxin Wang|arXiv (Cornell University)|Dec 20, 2021
Human Pose and Action Recognition被引用 6
一句话总结

该论文提出动态超图卷积网络(DHGCN)用于基于骨骼的动作识别,通过可学习关节权重和自适应拓扑的动态超图捕捉高阶运动关系。该方法在Kinetics-Skeleton 400、NTU RGB+D 60和NTU RGB+D 120数据集上实现最先进性能,通过关节-骨骼特征融合与动态结构自适应提升特征表示能力。

ABSTRACT

Graph convolutional networks (GCNs) based methods have achieved advanced performance on skeleton-based action recognition task. However, the skeleton graph cannot fully represent the motion information contained in skeleton data. In addition, the topology of the skeleton graph in the GCN-based methods is manually set according to natural connections, and it is fixed for all samples, which cannot well adapt to different situations. In this work, we propose a novel dynamic hypergraph convolutional networks (DHGCN) for skeleton-based action recognition. DHGCN uses hypergraph to represent the skeleton structure to effectively exploit the motion information contained in human joints. Each joint in the skeleton hypergraph is dynamically assigned the corresponding weight according to its moving, and the hypergraph topology in our model can be dynamically adjusted to different samples according to the relationship between the joints. Experimental results demonstrate that the performance of our model achieves competitive performance on three datasets: Kinetics-Skeleton 400, NTU RGB+D 60, and NTU RGB+D 120.

研究动机与目标

  • 解决固定拓扑图卷积网络在建模骨骼数据中人体关节间复杂高阶关系方面的局限性。
  • 通过超图结构捕捉超越成对关节连接的运动动态,提升动作识别性能。
  • 通过根据运动模式动态调整超图拓扑和关节重要性,实现模型在多样化动作类别中的自适应能力。
  • 通过整合静态与动态超图组件,实现骨骼序列中鲁棒的时空特征学习。
  • 通过学习数据相关的拓扑结构与权重,减少对人工设计特征和固定图结构的依赖。

提出的方法

  • 该方法采用由静态超图(用于基线拓扑)和动态超图(用于样本特定适应)组成的混合超图结构建模骨骼数据。
  • 基于每个关节的移动距离分配动态关节权重,在特征聚合过程中突出更活跃的关节。
  • 利用K近邻(K-NN)和K均值聚类构建动态超图拓扑,以捕捉每一样本的局部与全局关节关系。
  • 在组合的静态与动态超图上通过超图卷积提取空间特征,随后使用时间卷积网络(TCN)进行时空建模。
  • 引入关节-骨骼融合框架,通过结合关节坐标与骨骼向量增强表征能力。
  • 在来自多个数据集的骨骼序列上使用交叉熵损失端到端训练模型。

实验结果

研究问题

  • RQ1与传统固定拓扑图相比,动态超图结构在基于骨骼的动作识别中是否能更有效地捕捉人体关节间的高阶关系?
  • RQ2基于运动活跃度动态分配关节权重,如何改善特征表示与识别准确率?
  • RQ3通过K-NN与K均值实现的自适应超图拓扑构建,在多样化动作类别上的模型泛化能力提升程度如何?
  • RQ4静态与动态超图组件的融合是否相比静态或纯动态方法带来更优性能?
  • RQ5在Kinetics-Skeleton 400、NTU RGB+D 60和NTU RGB+D 120等大规模基准数据集上,所提出的DHGCN模型与最先进方法相比表现如何?

主要发现

  • 在NTU RGB+D 60数据集上,DHGCN在X-Sub划分中取得86.0%的Top-1准确率与87.9%的Top-5准确率,优于14种其他方法。
  • 在NTU RGB+D 120数据集上,DHGCN在对比方法中表现最佳,展现出在大规模数据上的强大泛化能力。
  • 在Kinetics-Skeleton 400数据集上,尽管面临骨骼数据噪声挑战,DHGCN仍取得具有竞争力的结果,Top-1与Top-5准确率分别为86.0%和87.9%。
  • 消融实验表明,动态关节加权与动态拓扑均对性能提升有显著贡献,关节-骨骼融合进一步提高了准确率。
  • 在NTU RGB+D 60的X-Sub基准上,DHGCN优于ST-TR与DGNN,尽管后者使用了注意力机制或有向无环图。
  • 该模型对不同动作中关节位置与角度的变化表现出鲁棒性,归因于其自适应超图构建机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。