[论文解读] Skeleton Cloud Colorization for Unsupervised 3D Action Representation Learning
本文提出骨架云着色方法用于无监督3D动作表征学习,通过将未标注的骨架序列转换为带有人工时间、空间和人物层级颜色标签的3D点云。该方法使用点云自编码器学习判别性时空特征,在无监督和半监督设置下达到最先进性能,并在NTU RGB+D和NW-UCLA数据集上实现监督动作识别的竞争力结果。
Skeleton-based human action recognition has attracted increasing attention in recent years. However, most of the existing works focus on supervised learning which requiring a large number of annotated action sequences that are often expensive to collect. We investigate unsupervised representation learning for skeleton action recognition, and design a novel skeleton cloud colorization technique that is capable of learning skeleton representations from unlabeled skeleton sequence data. Specifically, we represent a skeleton action sequence as a 3D skeleton cloud and colorize each point in the cloud according to its temporal and spatial orders in the original (unannotated) skeleton sequence. Leveraging the colorized skeleton point cloud, we design an auto-encoder framework that can learn spatial-temporal features from the artificial color labels of skeleton joints effectively. We evaluate our skeleton cloud colorization approach with action classifiers trained under different configurations, including unsupervised, semi-supervised and fully-supervised settings. Extensive experiments on NTU RGB+D and NW-UCLA datasets show that the proposed method outperforms existing unsupervised and semi-supervised 3D action recognition methods by large margins, and it achieves competitive performance in supervised 3D action recognition as well.
研究动机与目标
- 通过实现从无标注骨架序列中进行无监督表征学习,解决监督3D动作识别中高标注成本的挑战。
- 克服现有无监督方法依赖重建自监督机制的局限性,后者通常难以捕捉丰富的时空动态。
- 通过骨架云着色设计一种新颖的自监督信号,编码时间与空间顺序信息,且无需人工标注。
- 证明基于着色的表征学习方法可在无监督、半监督和全监督设置下泛化,并取得优异性能。
提出的方法
- 通过将所有帧的关节点坐标堆叠为点云,将每个3D骨架序列表示为3D骨架云。
- 使用三种不同的颜色方案对骨架云中的每个点进行着色:时间顺序(时间步)、空间顺序(关节点索引)和人物层级身份。
- 训练一个基于点云的自编码器,包含三个并行的编码器-解码器分支,每个分支处理骨架云的一种着色版本,以学习时空特征。
- 利用重建后的点云和颜色标签作为自监督信号,对编码器进行无监督预训练。
- 在半监督和监督设置中,使用少量标注数据对预训练编码器进行微调,结合线性分类器。
- 通过选择部分点(例如50%)进行重着色,平衡着色比例,确保有效特征学习且不过度依赖颜色信号。
实验结果
研究问题
- RQ1骨架云着色能否作为无监督3D动作表征学习的有效自监督信号?
- RQ2与现有无监督和半监督3D动作识别方法相比,该方法在准确率和泛化能力方面表现如何?
- RQ3与基线方法相比,引入时间、空间和人物层级着色在多大程度上提升了特征学习?
- RQ4该方法在无监督预训练中学习到的特征是否能在全监督动作识别设置中实现竞争力表现?
主要发现
- 所提出的骨架云着色方法在NTU RGB+D和NW-UCLA数据集上均优于当前最先进的无监督和半监督3D动作识别方法。
- 在NTU RGB+D数据集(跨主体设置)中,当50%的骨架云点被着色时,无监督学习的准确率达到71.6%。
- 在仅使用1%标注数据的半监督学习中,该方法显著优于现有无监督预训练基线,并取得强劲性能。
- 即使在全监督设置下,该方法仍能实现与当前最先进监督方法相当的竞争力表现,证明了所学表征的质量。
- 消融实验确认,三种着色流(时间、空间、人物层级)均对性能提升有贡献,其中时间与空间着色尤为有效。
- 该方法对不同着色比例具有鲁棒性,性能在50%着色点时达到峰值,表明信号强度与学习效率之间存在有利权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。