[论文解读] Hierarchical Contrast for Unsupervised Skeleton-based Action Representation Learning
该论文提出Hierarchical Contrast (HiCo),一种新颖的无监督骨架动作表征学习框架,能够从时序和空间域学习多层级特征,并在四个层级——实例、领域、片段和部位——上进行对比学习。HiCo在四个数据集上的动作识别与检索任务中均取得了最先进性能,展现出优异的可迁移性与半监督设置下的有效性。
This paper targets unsupervised skeleton-based action representation learning and proposes a new Hierarchical Contrast (HiCo) framework. Different from the existing contrastive-based solutions that typically represent an input skeleton sequence into instance-level features and perform contrast holistically, our proposed HiCo represents the input into multiple-level features and performs contrast in a hierarchical manner. Specifically, given a human skeleton sequence, we represent it into multiple feature vectors of different granularities from both temporal and spatial domains via sequence-to-sequence (S2S) encoders and unified downsampling modules. Besides, the hierarchical contrast is conducted in terms of four levels: instance level, domain level, clip level, and part level. Moreover, HiCo is orthogonal to the S2S encoder, which allows us to flexibly embrace state-of-the-art S2S encoders. Extensive experiments on four datasets, i.e., NTU-60, NTU-120, PKU-MMD I and II, show that HiCo achieves a new state-of-the-art for unsupervised skeleton-based action representation learning in two downstream tasks including action recognition and retrieval, and its learned action representation is of good transferability. Besides, we also show that our framework is effective for semi-supervised skeleton-based action recognition. Our code is available at https://github.com/HuiGuanLab/HiCo.
研究动机与目标
- 为解决现有对比学习方法在骨架动作识别中的局限性,即通常仅在整体实例层级进行对比,而未充分利用人体骨架的分层结构。
- 通过双分支编码器架构,对骨架在多个粒度层级(部位级、片段级、领域级和实例级)进行建模,以改进无监督表征学习。
- 通过在四个不同层级上应用分层对比学习,增强特征的判别能力,使其与人体运动的内在分层特性相一致。
- 实现所学表征在下游任务(如动作识别与检索)中的强可迁移性,即使在低资源或半监督设置下亦表现优异。
提出的方法
- HiCo采用双分支编码器网络:一个用于时序建模(处理不同长度的骨架序列片段),另一个用于空间建模(提取不同大小身体部位的特征)。
- 该框架使用序列到序列(S2S)编码器和统一下采样模块,在时序与空间域中生成多粒度特征。
- 在四个层级上执行分层对比:实例级(不同骨架序列之间)、领域级(不同数据划分之间)、片段级(时序片段内部)和部位级(空间身体部位内部)。
- 该方法与S2S编码器正交,可与最先进的编码器(如Transformer)集成,并支持灵活的架构设计。
- 在每个层级应用对比损失,通过渐进式优化:将部位级特征组合为片段级,再组合为领域级,最终形成实例级表征。
- 通过数据增强生成对比学习的正样本对,且框架以端到端方式在无监督设置下进行训练。
实验结果
研究问题
- RQ1与传统的实例级对比学习相比,跨多粒度层级的分层对比学习是否能提升无监督骨架动作表征学习性能?
- RQ2时序与空间多层级表征的融合如何增强特征判别能力与模型泛化性能?
- RQ3所提出的HiCo框架在不同数据集上的下游任务(如动作识别与检索)中具有多大程度的泛化能力?
- RQ4在标注数据稀缺的少样本或半监督设置下,HiCo的性能表现如何?
主要发现
- HiCo在四个基准数据集(NTU-60、NTU-120、PKU-MMD I 和 PKU-MMD II)上的动作识别与检索任务中均实现了最先进性能,相比以往无监督方法有显著准确率提升。
- 在NTU-60数据集的x-sub协议下,HiCo-Transformer达到81.1%的准确率,较之前最先进方法(CrosSCLR)高出1.4个百分点。
- 在迁移学习设置中,当在NTU-60上预训练后,HiCo在PKU-MMD II上达到56.3%的准确率,显著优于先前方法(如LongT GAN的44.8%和ISC的45.9%)。
- 在NTU-60数据集上仅使用1%标注数据的半监督学习设置中,HiCo-Transformer达到54.4%的准确率,超越所有基线方法,包括参数量更大的模型。
- 消融实验表明,分层对比至关重要:逐步增加领域级以及片段&部位级对比可带来持续的性能增益,完整四层级对比达到最佳效果。
- 双分支结构(时序与空间)优于单分支变体,证明了对时序动态与空间身体部位结构进行联合建模具有互补优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。