[论文解读] Hierarchical Consistent Contrastive Learning for Skeleton-Based Action Recognition with Growing Augmentations
本文提出 HiCLR,一种用于基于骨骼动作识别的层次化一致对比学习框架,通过渐进式增强策略逐步应用更强的增强操作,并利用非对称损失函数强制实现层次一致性。该方法在 NTU60、NTU120 和 PKUMMD 数据集上显著优于当前最先进方法,在线性、KNN、半监督和监督评估协议下,采用 GCN 和 Transformer 主干网络均取得了新的 SOTA 结果。
Contrastive learning has been proven beneficial for self-supervised skeleton-based action recognition. Most contrastive learning methods utilize carefully designed augmentations to generate different movement patterns of skeletons for the same semantics. However, it is still a pending issue to apply strong augmentations, which distort the images/skeletons' structures and cause semantic loss, due to their resulting unstable training. In this paper, we investigate the potential of adopting strong augmentations and propose a general hierarchical consistent contrastive learning framework (HiCLR) for skeleton-based action recognition. Specifically, we first design a gradual growing augmentation policy to generate multiple ordered positive pairs, which guide to achieve the consistency of the learned representation from different views. Then, an asymmetric loss is proposed to enforce the hierarchical consistency via a directional clustering operation in the feature space, pulling the representations from strongly augmented views closer to those from weakly augmented views for better generalizability. Meanwhile, we propose and evaluate three kinds of strong augmentations for 3D skeletons to demonstrate the effectiveness of our method. Extensive experiments show that HiCLR outperforms the state-of-the-art methods notably on three large-scale datasets, i.e., NTU60, NTU120, and PKUMMD.
研究动机与目标
- 为解决自监督基于骨骼的动作识别中强数据增强导致的不稳定性和性能下降问题。
- 通过系统性地利用强增强而不牺牲语义一致性,提升表示学习效果。
- 设计一种对比学习框架,以非对称方式处理不同增强,优先保证从弱视图到强视图的层次一致性。
- 在多种主干网络(GCN 和 Transformer)和评估协议下,验证所提方法的有效性。
- 提供一种可泛化、可扩展的自监督骨骼表示学习框架,优于现有方法。
提出的方法
- 设计了一种渐进式增长增强策略,用于生成多个有序的正样本对,逐步从弱增强到强增强。
- 引入非对称损失函数,通过将强增强视图的特征拉近到弱增强视图的特征,强制实现层次一致性。
- 在特征空间中采用方向性聚类,引导模型学习跨增强层次的一致表示。
- 提出了三种新颖的 3D 骨骼强增强方法并进行了评估:随机掩码(Random Mask)、抖动(Jitter)和断开连接(Drop-Connect),以增强表示多样性。
- 该框架兼容 GCN 和 Transformer 主干网络,可在不同架构中广泛适用。
- 训练流程整合了层次化正样本对与非对称对比学习,以稳定训练并提升泛化能力。
实验结果
研究问题
- RQ1能否在自监督基于骨骼的动作识别中有效利用强数据增强,而不会引起语义漂移或训练不稳定?
- RQ2如何强制实现逐步增强视图之间的层次一致性,以提升特征表示质量?
- RQ3在强增强与弱增强对齐的非对称学习中,对下游动作识别性能有何影响?
- RQ4在各种评估协议(线性、KNN、半监督、监督)下,所提框架与现有对比学习方法相比表现如何?
- RQ5该框架能否在不同主干架构(如 GCN 和 Transformer)上实现泛化,同时保持 SOTA 性能?
主要发现
- 在 NTU60 的 xsub 和 xview 协议上,HiCLR 分别取得了 88.3% 和 93.2% 的 top-1 准确率,超越了之前的 SOTA 方法。
- 在 NTU120 数据集上,HiCLR 在 xsub 和 xset 协议上分别达到 85.6% 和 87.5% 的准确率,创下新的 SOTA 基准。
- 在仅使用 1% 训练数据的半监督学习设置下,HiCLR 在 xsub 和 xview 上分别取得 84.0% 和 84.8% 的准确率,大幅优于先前方法。
- 仅使用 1% 的模型参数,HiCLR 的性能即可与更大的基于 Transformer 的模型相当或更优,展现出极高的效率。
- 在 KNN 评估中,HiCLR 相较于基线方法(如 SkeletonCLR 和 AimCLR)提升 10-15%,表明其特征空间更具判别性。
- 该方法在所有评估协议下(包括监督、线性、KNN 设置)均持续优于当前最先进方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。