Skip to main content
QUICK REVIEW

[论文解读] Human Action Recognition with Multi-Laplacian Graph Convolutional Networks

Ahmed Cherif Mazari, Hichem Sahbi|arXiv (Cornell University)|Oct 15, 2019
Human Pose and Action Recognition参考文献 103被引用 4
一句话总结

该论文提出了一种多拉普拉斯图卷积网络(MLGCN),通过将针对不同图拓扑结构的基底拉普拉斯矩阵组合为凸组合,用于人体动作识别。该方法通过上下文感知的两步池化机制增强特征表示,在SBU和UCF-101数据集上实现了最先进性能,使用向量模型的晚期融合方法在SBU上达到98.60%的准确率,在UCF-101上达到63.27%的准确率。

ABSTRACT

Convolutional neural networks are nowadays witnessing a major success in different pattern recognition problems. These learning models were basically designed to handle vectorial data such as images but their extension to non-vectorial and semi-structured data (namely graphs with variable sizes, topology, etc.) remains a major challenge, though a few interesting solutions are currently emerging. In this paper, we introduce MLGCN; a novel spectral Multi-Laplacian Graph Convolutional Network. The main contribution of this method resides in a new design principle that learns graph-laplacians as convex combinations of other elementary laplacians each one dedicated to a particular topology of the input graphs. We also introduce a novel pooling operator, on graphs, that proceeds in two steps: context-dependent node expansion is achieved, followed by a global average pooling; the strength of this two-step process resides in its ability to preserve the discrimination power of nodes while achieving permutation invariance. Experiments conducted on SBU and UCF-101 datasets, show the validity of our method for the challenging task of action recognition.

研究动机与目标

  • 解决固定拓扑图卷积网络在处理具有不同时空拓扑结构的可变尺寸、半结构化人体动作图时的局限性。
  • 通过设计对节点排序不敏感的池化机制,克服图基动作识别中的排列敏感性挑战。
  • 通过动态组合适用于不同图配置的多个拉普拉斯算子,提升图结构人体动作数据的表征学习能力。
  • 在基准数据集上,证明所提方法相对于图基和向量基深度学习基线模型的有效性与互补性。

提出的方法

  • 提出一种新颖的谱图卷积网络框架,通过多个基底拉普拉斯矩阵的凸组合学习复合拉普拉斯矩阵,每个基底拉普拉斯矩阵针对特定图拓扑结构进行优化。
  • 每个基底拉普拉斯矩阵基于不同的图结构(如基于关节点邻近性、时间连续性或几何构型)构建,从而实现对复杂人体运动模式的自适应建模。
  • 引入一种两阶段池化算子:首先利用邻近节点的上下文信息扩展节点特征,然后应用全局平均池化,以在保持判别能力的同时确保排列不变性。
  • 在消息传递过程中,通过可学习的注意力机制对基底拉普拉斯矩阵进行动态加权,增强对拓扑变化的鲁棒性。
  • 采用骨架序列的时间分块策略,以改善长距离依赖建模,尤其在捕捉复杂动作动态方面表现优异。
  • 使用交叉熵损失函数,配合ReLU或Leaky ReLU激活函数,端到端训练模型,并在SBU和UCF-101数据集上使用标准动作识别指标评估性能。

实验结果

研究问题

  • RQ1多拉普拉斯设计是否能提升图卷积网络在可变拓扑图上的人体动作识别表征能力?
  • RQ2上下文感知的两步池化机制是否能在保持排列不变性的同时增强图基动作识别中的特征判别能力?
  • RQ3所提出的MLGCN在SBU和UCF-101等标准基准数据集上,与最先进图基和向量基模型相比表现如何?
  • RQ4在存在遮挡和背景杂波等挑战性场景下,MLGCN通过晚期融合与现有深度学习模型的互补程度如何?
  • RQ5不同节点特征表示(如关节点坐标、方向、距离)对所提MLGCN框架性能有何影响?

主要发现

  • 所提MLGCN在SBU-骨架数据集上达到98.60%的准确率,优于所有基底图模型和向量模型,包括与3D CNN的晚期融合结果。
  • 在UCF-101数据集上,MLGCN在最优设置下达到63.27%的准确率,即使在复杂背景杂波和可变相机运动条件下也表现出强劲性能。
  • 消融实验表明,所提出的两步池化机制(上下文扩展 + 全局平均池化)显著优于标准全局池化或仅使用特征传播的方法。
  • 通过凸组合使用多个拉普拉斯矩阵,相比单拉普拉斯基线模型,准确率提升2.0–3.0%,凸显了拓扑自适应性的优势。
  • MLGCN与3D CNN的晚期融合在UCF-101上带来额外1.5–2.0%的准确率提升,证实其与向量模型具有良好的互补性。
  • 该方法在不同节点特征表示下均表现稳健,当使用关节点连线距离或方向特征时性能最高,因其能更丰富地编码时空动态信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。