[论文解读] Hierarchically Decomposed Graph Convolutional Networks for Skeleton-Based Action Recognition
该论文提出了一种分层分解图卷积网络(HD-GCN),用于基于骨骼的动作识别,引入了一种新颖的分层分解图(HD-Graph),通过从质心(CoM)组织关节形成语义层级,捕捉相邻及结构上相距较远的关节关系。该方法采用注意力引导的层级聚合(A-HA)模块,动态强调关键的边集,并通过使用不同质心节点的六路联合与骨骼流集成,实现了在四个基准数据集上的最先进性能,且无需使用运动流。
Graph convolutional networks (GCNs) are the most commonly used methods for skeleton-based action recognition and have achieved remarkable performance. Generating adjacency matrices with semantically meaningful edges is particularly important for this task, but extracting such edges is challenging problem. To solve this, we propose a hierarchically decomposed graph convolutional network (HD-GCN) architecture with a novel hierarchically decomposed graph (HD-Graph). The proposed HD-GCN effectively decomposes every joint node into several sets to extract major structurally adjacent and distant edges, and uses them to construct an HD-Graph containing those edges in the same semantic spaces of a human skeleton. In addition, we introduce an attention-guided hierarchy aggregation (A-HA) module to highlight the dominant hierarchical edge sets of the HD-Graph. Furthermore, we apply a new six-way ensemble method, which uses only joint and bone stream without any motion stream. The proposed model is evaluated and achieves state-of-the-art performance on four large, popular datasets. Finally, we demonstrate the effectiveness of our model with various comparative experiments.
研究动机与目标
- 通过捕捉结构上相距较远关节之间的语义上有意义的关系,解决基于骨骼的动作识别中的长距离依赖问题。
- 克服现有基于GCN的方法中固定手工设计图(如仅PC边)的局限性以及次优的特征聚合问题。
- 开发一种动态自适应机制,以突出每个动作样本中最相关的分层边集。
- 通过设计仅使用不同质心节点的六路集成(联合与骨骼流),消除对运动流和人工集成系数的依赖。
提出的方法
- 通过从质心(CoM)节点开始,将骨骼关节组织为语义层级,构建分层分解图(HD-Graph),并通过连接相邻层级的节点来捕捉长距离依赖关系。
- 基于距CoM的距离定义层级节点集,同一层级内的节点构成一个语义组,从而实现对远距离关节关系的结构化表示。
- 借鉴三维点云方法中的空间边卷积(S-EdgeConv),用于建模HD-Graph未捕捉到的语义上接近但非相邻的边。
- 引入注意力引导的层级聚合(A-HA)模块,结合代表性空间平均池化(RSAP)以防止缩放偏差,并通过层级边卷积(H-EdgeConv)利用特征空间中的欧氏距离识别主导的层级特征。
- 实施六路集成策略,使用在三个不同CoM节点(胸、腹、髋)上训练的联合与骨骼流,各分支贡献相等,无需人工调参。
- 仅使用联合与骨骼模态流,完全省略运动流,以提升鲁棒性并降低复杂度,同时保持高性能。
实验结果
研究问题
- RQ1将骨骼关节分层分解为语义层级,是否能有效提升图卷积网络在动作识别中对长距离依赖关系的建模能力?
- RQ2动态注意力机制在多大程度上能有效识别并强调不同动作类别中最具判别性的分层边集?
- RQ3通过完全消除运动流并仅依赖联合与骨骼特征及多质心集成策略,性能可提升至何种程度?
- RQ4所提出的HD-Graph架构是否在捕捉人体骨骼的局部与全局结构关系方面,优于固定手工图和可学习图?
主要发现
- HD-GCN在四个大型基于骨骼的动作识别基准数据集上实现了最先进性能,包括在NTU-RGB+D 120 X-Set划分上达到97.2%的准确率,X-Sub划分上达到91.6%的准确率(六路集成)。
- 仅使用联合与骨骼流及三个不同CoM节点的六路集成方法,在X-Sub上达到93.4%的准确率,在X-Set上达到97.2%的准确率,优于包含运动流的模型。
- 在单流实验中,模型在NTU-RGB+D 120 X-Sub和X-Set划分上分别达到85.7%和87.3%的准确率,超越了先前最先进方法如DC-GCN、MS-G3D、CTR-GCN和InfoGCN。
- 消融实验表明,不同CoM节点(胸、腹、髋)在各类别上的性能差异最高可达13%,验证了集成的多样性与互补性。
- HD-Graph架构有效建模了远距离关节关系,例如左右肢体之间的关系,这对击掌、深蹲等动作至关重要。
- A-HA模块通过利用特征空间距离和代表性节点池化,成功识别并强调了主导的分层边集(如击掌动作中的手与手连接)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。