[论文解读] Learning Discriminative Representations for Skeleton Based Action Recognition
本文提出一种即插即用的特征精炼头(FR-Head),通过利用时空解耦和对比学习,增强基于骨架的动作识别中的判别性表征。该方法通过置信原型动态识别并校准模糊样本,在NTU RGB+D、NTU RGB+D 120和NW-UCLA数据集上实现最先进性能,对模糊动作组的Top-1准确率最高提升1.4%。
Human action recognition aims at classifying the category of human action from a segment of a video. Recently, people have dived into designing GCN-based models to extract features from skeletons for performing this task, because skeleton representations are much more efficient and robust than other modalities such as RGB frames. However, when employing the skeleton data, some important clues like related items are also discarded. It results in some ambiguous actions that are hard to be distinguished and tend to be misclassified. To alleviate this problem, we propose an auxiliary feature refinement head (FR Head), which consists of spatial-temporal decoupling and contrastive feature refinement, to obtain discriminative representations of skeletons. Ambiguous samples are dynamically discovered and calibrated in the feature space. Furthermore, FR Head could be imposed on different stages of GCNs to build a multi-level refinement for stronger supervision. Extensive experiments are conducted on NTU RGB+D, NTU RGB+D 120, and NW-UCLA datasets. Our proposed models obtain competitive results from state-of-the-art methods and can help to discriminate those ambiguous samples. Codes are available at https://github.com/zhysora/FR-Head.
研究动机与目标
- 为解决基于骨架的方法在动作识别中面临的模糊性挑战,即由于缺少上下文和物体级线索,相似动作(如书写、阅读、打字)难以区分。
- 通过在训练过程中识别模糊样本并利用对比学习精炼表征,提升特征的判别能力。
- 设计一种轻量化、模块化的组件,可集成到各种GCN骨干网络中,实现多层级特征增强。
- 在不增加推理成本的前提下,提升对模糊动作组的性能,支持即插即用部署。
提出的方法
- FR-Head将原始特征解耦为空间和时间分量,实现沿各维度的聚焦精炼,提升对判别性模式的敏感度。
- 通过对比损失识别置信样本(高预测置信度),以维持类原型,最小化类内距离并最大化类间距离。
- 在特征空间中,通过将模糊样本推向正确类原型或远离错误类原型,实现动态校准。
- 该模块被应用于GCN骨干网络的多个阶段,实现多层级精炼,并联合优化分类损失与对比损失。
- 采用基于动量的原型更新策略,以稳定训练过程并提升泛化能力。
- 该方法与现有GCN模型兼容,且可在推理阶段移除,确保无运行时开销。
实验结果
研究问题
- RQ1对比学习能否被有效用于提升基于骨架的动作识别中模糊动作的判别性表征学习?
- RQ2如何实现空间与时间特征的解耦并分别精炼,以增强模型对细微动作差异的敏感度?
- RQ3即插即用模块能否在不修改骨干网络架构的前提下,提升对模糊动作组的性能?
- RQ4在GCN各阶段进行多层级精炼,对困难动作类别识别准确率的提升程度如何?
- RQ5在模糊动作组上的准确率和鲁棒性方面,所提方法与最先进模型相比表现如何?
主要发现
- 所提出的FR-Head在NTU RGB+D 120的X-Sub划分上达到92.8%的Top-1准确率,优于先前最先进方法CTR-GCN的0.4%。
- 在NTU RGB+D的X-View划分上,该方法达到96.8%的Top-1准确率,在所有报告方法中排名第一。
- 在NW-UCLA数据集上,模型达到96.8%的Top-1准确率,创下新的最先进结果。
- 在分组评估中,与CTR-GCN相比,该方法在模糊动作组上的准确率最高提升1.4个百分点。
- t-SNE可视化结果表明,所提方法生成的模糊动作特征簇更加紧凑且分离良好。
- 消融实验验证了时空解耦与对比精炼均为性能提升的关键因素,各组件对判别性均有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。