Skip to main content
QUICK REVIEW

[论文解读] Topology-aware Convolutional Neural Network for Efficient Skeleton-based Action Recognition

Kailin Xu, Fanfan Ye|arXiv (Cornell University)|Dec 8, 2021
Human Pose and Action Recognition被引用 10
一句话总结

本文提出拓扑感知卷积神经网络(Ta-CNN),一种用于高效骨骼动作识别的纯卷积神经网络,通过新颖的跨通道特征增强模块和定制的SkeletonMix数据增强策略,显著提升了拓扑特征学习能力。该方法在参数量和GFLOPs方面相比基于CNN和GCN的模型均有显著减少,同时实现了最先进(SOTA)的准确率。

ABSTRACT

In the context of skeleton-based action recognition, graph convolutional networks (GCNs) have been rapidly developed, whereas convolutional neural networks (CNNs) have received less attention. One reason is that CNNs are considered poor in modeling the irregular skeleton topology. To alleviate this limitation, we propose a pure CNN architecture named Topology-aware CNN (Ta-CNN) in this paper. In particular, we develop a novel cross-channel feature augmentation module, which is a combo of map-attend-group-map operations. By applying the module to the coordinate level and the joint level subsequently, the topology feature is effectively enhanced. Notably, we theoretically prove that graph convolution is a special case of normal convolution when the joint dimension is treated as channels. This confirms that the topology modeling power of GCNs can also be implemented by using a CNN. Moreover, we creatively design a SkeletonMix strategy which mixes two persons in a unique manner and further boosts the performance. Extensive experiments are conducted on four widely used datasets, i.e. N-UCLA, SBU, NTU RGB+D and NTU RGB+D 120 to verify the effectiveness of Ta-CNN. We surpass existing CNN-based methods significantly. Compared with leading GCN-based methods, we achieve comparable performance with much less complexity in terms of the required GFLOPs and parameters.

研究动机与目标

  • 为解决CNN在建模不规则骨骼拓扑结构方面的局限性,这一局限性导致其在GCN的对比下被较少采用。
  • 证明当关节被视为通道时,图卷积可被视为标准卷积的特例,从而为CNN有效建模拓扑结构提供理论依据。
  • 设计一种轻量化、纯CNN架构,在保持低计算成本的同时,实现与基于GCN的方法相当的性能。
  • 提出一种新型数据增强策略SkeletonMix,专为骨骼序列设计,以提升泛化能力与鲁棒性。

提出的方法

  • 提出一种跨通道特征增强模块,结合map-attend-group-map操作,以增强坐标与关节特征。
  • 引入坐标感知分组(CAG)模块,通过特征映射、通道注意力和双坐标卷积,建模关节间交互关系。
  • 设计虚拟部件感知分组(VAG)模块,通过基于身体部位语义的特征分组,进一步挖掘拓扑结构信息。
  • 从理论上证明:当将关节维度视为通道时,图卷积是标准卷积的特例,为CNN用于拓扑建模提供理论支持。
  • 开发一种新型SkeletonMix策略,通过混合来自两个不同人的上半身与下半身,以模态感知方式增强训练数据。
  • 采用双流架构,分别处理骨骼序列与运动信息,并通过后期特征融合提升表征学习能力。

实验结果

研究问题

  • RQ1纯CNN模型能否有效学习并利用人体骨骼数据中不规则的拓扑结构?
  • RQ2当将关节视为通道时,图卷积与标准卷积之间是否存在理论等价性?
  • RQ3是否可通过新型跨通道特征增强机制,在不依赖邻接矩阵的前提下提升CNN的拓扑建模能力?
  • RQ4如SkeletonMix这类模态特定的数据增强策略,能否提升基于骨骼的动作识别中的泛化能力与性能?
  • RQ5轻量化CNN模型能否在显著降低模型复杂度的同时,实现与重型GCN模型相当的性能?

主要发现

  • 在N-UCLA数据集上,Ta-CNN达到97.2%的SOTA准确率,超越所有先前基于CNN的方法,并与领先的GCN方法持平或更优。
  • 在SBU数据集上,Ta-CNN实现98.9%的准确率,创下新SOTA记录,且模型尺寸显著小于先前方法。
  • 在NTU RGB+D数据集上,Ta-CNN在跨被试设置下取得90.4%的top-1准确率,优于所有现有基于CNN的方法,并与顶尖GCN模型持平,同时FLOPs与参数量更低。
  • 在NTU RGB+D 120数据集上,Ta-CNN在跨被试设置下达到85.7%的准确率,展现出强大的泛化能力与效率,尤其相较于重型GCN基线模型优势明显。
  • 所提出的SkeletonMix策略在所有数据集上均提升性能,而原始mixup方法则导致性能下降,证明其有效性与模态特定设计的合理性。
  • 理论分析证实:当将关节维度视为通道时,图卷积是标准卷积的特例,为基于CNN的拓扑建模提供了理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。