[论文解读] Constructing Stronger and Faster Baselines for Skeleton-based Action Recognition
本文提出 EfficientGCN-Bx,一种用于基于骨骼动作识别的高效且准确的图卷积网络基线模型族。通过早期融合关节、运动和骨骼特征,结合可分离卷积,并应用复合缩放策略,EfficientGCN-B4 在 NTU RGB+D 60 跨被试基准上实现了最先进准确率(92.1%),同时模型参数量减少为 MS-G3D 的 1/5.82,推理速度提升至 5.85 倍。
One essential problem in skeleton-based action recognition is how to extract discriminative features over all skeleton joints. However, the complexity of the recent State-Of-The-Art (SOTA) models for this task tends to be exceedingly sophisticated and over-parameterized. The low efficiency in model training and inference has increased the validation costs of model architectures in large-scale datasets. To address the above issue, recent advanced separable convolutional layers are embedded into an early fused Multiple Input Branches (MIB) network, constructing an efficient Graph Convolutional Network (GCN) baseline for skeleton-based action recognition. In addition, based on such the baseline, we design a compound scaling strategy to expand the model's width and depth synchronously, and eventually obtain a family of efficient GCN baselines with high accuracies and small amounts of trainable parameters, termed EfficientGCN-Bx, where "x" denotes the scaling coefficient. On two large-scale datasets, i.e., NTU RGB+D 60 and 120, the proposed EfficientGCN-B4 baseline outperforms other SOTA methods, e.g., achieving 91.7% accuracy on the cross-subject benchmark of NTU 60 dataset, while being 3.15x smaller and 3.21x faster than MS-G3D, which is one of the best SOTA methods. The source code in PyTorch version and the pretrained models are available at https://github.com/yfsong0709/EfficientGCNv1.
研究动机与目标
- 解决近期基于骨骼的动作识别 SOTA 模型存在的高计算成本与过度参数化问题。
- 通过最小化冗余参数与计算量,在不牺牲性能的前提下降低模型复杂度。
- 设计一种可扩展、高效的基线模型,在 NTU RGB+D 60 和 120 等大规模数据集上保持高准确率。
- 在人体重识别等相关任务上验证所提出模型的泛化能力。
提出的方法
- 提出一种早期融合的多输入分支(MIB)架构,在网络初始层即融合关节位置、运动速度与骨骼特征,以减少冗余。
- 设计四种新型时间卷积(TC)层——瓶颈型、可分离型、扩展可分离型与沙漏型,适配于 GCN,以压缩模型大小并提升效率。
- 采用复合缩放策略,统一缩放模型宽度与深度,实现系统性的效率-准确率权衡。
- 引入空间-时间联合注意力(ST-JointAtt)模块,自适应地突出关键关节与时间帧,降低填充或无信息帧带来的噪声影响。
- 采用改进的 GCN 主干网络,结合可分离卷积,显著降低 FLOPs 与参数量,同时保持判别能力。
- 通过全面搜索验证最优融合阶段,确认早期融合在参数效率方面最为有效。
实验结果
研究问题
- RQ1在基于骨骼的动作识别任务中,多流 GCN 模型的最优融合阶段是什么?其对模型效率与准确率有何影响?
- RQ2可分离卷积与瓶颈结构能否有效适配于 GCN,以在不损失性能的前提下降低模型复杂度?
- RQ3与晚期融合相比,关节、运动与骨骼特征的早期融合在参数效率与性能方面表现如何?
- RQ4复合缩放策略在 GCN 基的骨骼识别模型中,对效率-准确率权衡的提升程度如何?
- RQ5所提出的 EfficientGCN 基线模型在动作识别之外的其他基于骨骼的任务中是否具备良好的泛化能力?
主要发现
- EfficientGCN-B4 在 NTU RGB+D 60 的跨被试基准上达到 92.1% 的准确率,超越所有先前的 SOTA 方法。
- 该模型较领先的 SOTA 模型 MS-G3D 小 5.82 倍,推理速度提升 5.85 倍,同时准确率更高。
- 与晚期融合相比,早期融合策略在多流 GCN 架构中显著减少了冗余参数。
- ST-JointAtt 模块成功突出关键关节(如挥手动作中的手臂)并抑制无信息帧,尤其在深层网络中表现显著。
- 在四个行人重识别基准上,EfficientGCN-B4 分别取得 64.5%、67.3%、62.4% 和 96.1% 的 rank-1 准确率,优于所有先前 SOTA 方法。
- 该模型在动作识别之外的任务中也表现出良好泛化能力,尤其在基于骨骼的行人重识别任务中表现强劲。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。