Skip to main content
QUICK REVIEW

[论文解读] Fusing Higher-order Features in Graph Neural Networks for Skeleton-based Action Recognition

Zhenyue Qin, Yang Liu|arXiv (Cornell University)|May 4, 2021
Human Pose and Action Recognition参考文献 31被引用 6
一句话总结

本文提出角度编码作为一种高阶特征表示方法,以增强图神经网络中的基于骨架的动作识别。通过将来自静态和速度域中关节角度的高阶特征融合进现有的ST-GCN与解耦GCN架构,该方法在NTU60和NTU120数据集上实现了新的最先进准确率,参数量更少且推理时间更短,显著提升了对运动轨迹相似动作的判别能力。

ABSTRACT

Skeleton sequences are lightweight and compact, and thus are ideal candidates for action recognition on edge devices. Recent skeleton-based action recognition methods extract features from 3D joint coordinates as spatial-temporal cues, using these representations in a graph neural network for feature fusion to boost recognition performance. The use of first- and second-order features, i.e., joint and bone representations, has led to high accuracy. Nonetheless, many models are still confused by actions that have similar motion trajectories. To address these issues, we propose fusing higher-order features in the form of angular encoding into modern architectures to robustly capture the relationships between joints and body parts. This simple fusion with popular spatial-temporal graph neural networks achieves new state-of-the-art accuracy in two large benchmarks, including NTU60 and NTU120, while employing fewer parameters and reduced run time. Our source code is publicly available at: https://github.com/ZhenyueQin/Angular-Skeleton-Encoding.

研究动机与目标

  • 为解决基于骨架的动作识别中难以区分运动轨迹相似动作的挑战。
  • 提升模型对人体尺寸和运动速度变化的鲁棒性。
  • 通过引入超越一阶与二阶特征的高阶结构关系,增强图神经网络的特征表示能力。
  • 通过高效、轻量级的角度特征融合,实现在边缘设备上的实时动作识别。

提出的方法

  • 提出四种类型的角度编码:中心导向型、基于部件型、基于手指型和基于速度型,均源自构成角度的三元关节组。
  • 在静态(关节坐标)和速度(连续帧间差分)两个域中定义角度特征,以捕捉动态运动模式。
  • 通过拼接方式将角度特征与现有的关节和骨骼表示融合,再输入时空GCN主干网络。
  • 将该融合方法应用于STGCN和解耦GCN等标准架构,实现即插即用的集成,无需对网络结构进行大规模修改。
  • 采用三阶段主干网络,结合空间多尺度图卷积与时间多尺度卷积,以提取分层时空特征。
  • 通过将每个角度视为超边,采用类超图建模方法,扩展传统GCN能力,以捕捉三阶关系。

实验结果

研究问题

  • RQ1高阶特征(如关节角度)是否能提升基于骨架的动作识别中对运动轨迹相似动作的判别能力?
  • RQ2与一阶和二阶特征(关节与骨骼)相比,角度编码在准确率和鲁棒性方面表现如何?
  • RQ3将角度特征与现有GCN主干网络融合,是否能在不同架构和数据集上持续带来性能提升?
  • RQ4角度编码在静态域与速度域中均有效吗?哪个域能带来更大的性能增益?
  • RQ5所提方法是否能在保持低计算成本的前提下实现最先进准确率,从而适用于边缘设备部署?

主要发现

  • 将角度编码融合进STGCN与解耦GCN模型后,在NTU60和NTU120基准测试中达到新的最先进准确率,分别在速度输入和静态输入上实现1.42%和0.58%的平均准确率提升。
  • 基于部件的角度编码在速度输入上使准确率提升1.47%,表明其对涉及手臂和腿部动作的动态行为具有显著互补性。
  • 中心导向型角度编码在所有主干网络中均带来最大准确率提升,表明其在捕捉整体身体姿态动态方面的有效性。
  • 该方法在三种不同主干网络(ShiftGCN、DecoupleGCN、MSG3D)上均持续提升性能,展现出强大的泛化能力。
  • 结合速度域特征的角度编码比静态域特征带来更大的准确率增益,尤其在长时行动作为“翻书”等任务中表现更优。
  • 与先前最先进模型相比,所提方法降低了计算成本,支持在边缘设备上实现实时推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。