Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Human Action Recognition with Skeletal Graph Laplacian and Self-Supervised Viewpoints Invariance

G Paoletti, Jacopo Cavazza|arXiv (Cornell University)|Apr 21, 2022
Human Pose and Action Recognition被引用 10
一句话总结

本文提出了一种使用图拉普拉斯正则化卷积自编码器的无监督人体动作识别方法,以学习视角不变的骨骼表征。通过集成自监督梯度反转层实现视角不变性,并在重建空间中引入拉普拉斯正则化,该方法在NTU-60和NTU-120数据集上实现了最先进性能,超越了以往的无监督方法,甚至匹配了部分有监督方法。

ABSTRACT

This paper presents a novel end-to-end method for the problem of skeleton-based unsupervised human action recognition. We propose a new architecture with a convolutional autoencoder that uses graph Laplacian regularization to model the skeletal geometry across the temporal dynamics of actions. Our approach is robust towards viewpoint variations by including a self-supervised gradient reverse layer that ensures generalization across camera views. The proposed method is validated on NTU-60 and NTU-120 large-scale datasets in which it outperforms all prior unsupervised skeleton-based approaches on the cross-subject, cross-view, and cross-setup protocols. Although unsupervised, our learnable representation allows our method even to surpass a few supervised skeleton-based action recognition methods. The code is available in: www.github.com/IIT-PAVIS/UHAR_Skeletal_Laplacian

研究动机与目标

  • 为解决有监督人体动作识别的高成本与局限性,提出一种无监督方法,从无标注的3D骨骼序列中学习有意义的表征。
  • 通过对抗训练引入自监督视角不变性,提升在真实场景部署中对视角变化的鲁棒性。
  • 通过在骨骼拓扑上应用图拉普拉斯正则化,引入结构几何先验,增强特征学习能力。
  • 证明无监督预训练结合几何约束与不变性约束可获得与有监督方法相媲美的表征。

提出的方法

  • 使用残差卷积自编码器,以无监督方式从3D骨骼序列中学习时空表征。
  • 在重建空间中应用图拉普拉斯正则化,以保持骨骼几何结构并强制潜在表征的平滑性。
  • 引入自监督梯度反转层,通过对抗回归对输入骨骼施加的随机旋转扰动,学习视角不变特征。
  • 利用通过随机旋转生成的合成数据增强训练过程,提升泛化能力,尤其在跨视角与跨设置协议下表现更优。
  • 模型采用端到端训练,损失函数包括重建损失与自监督回归损失,梯度反转机制使视角不变性得以实现,且无需依赖标注的视角数据。
  • 在NTU-60与NTU-120数据集上,采用跨被试、跨视角与跨设置设置,通过1-NN与线性评估协议评估性能。

实验结果

研究问题

  • RQ1图拉普拉斯正则化是否能通过编码骨骼几何结构,改善无监督人体动作识别的特征学习?
  • RQ2通过梯度反转实现的自监督视角不变性,是否相比现有无监督方法,能带来更好的跨相机视角泛化能力?
  • RQ3结合几何约束与不变性约束的无监督自编码器,是否能在大规模HAR基准上实现与有监督方法相当的性能?
  • RQ4使用带有旋转扰动的合成数据,对模型在跨视角与跨设置评估协议下的泛化能力有何影响?

主要发现

  • 所提出的GRAE-L模型仅使用合成数据,在NTU-60 C-View上达到82.4%准确率,在NTU-120 C-Setup上达到48.9%,优于所有先前的无监督骨骼基方法。
  • 在NTU-60 C-Subject上,该方法在跨视角协议中达到81.0%准确率,在跨被试协议中达到52.3%,超越了以往SOTA无监督方法。
  • 即使完全无标注数据,该方法在性能上仍超过多个有监督骨骼基HAR方法,尤其在跨视角与跨设置设置中表现更优。
  • 消融实验表明,具备自监督视角不变性(SSVI)的模型始终优于基线自编码器与AE-L,尤其在真实数据稀缺或无预处理条件下优势更明显。
  • 使用线性分类器微调无监督编码器后,在NTU-60 C-View上达到83.8%准确率,在NTU-120 C-Setup上达到61.1%,证明了所学特征的强大迁移能力。
  • 与真实数据相比,仅在合成数据上训练时性能有所下降,但SSVI模型仍显著优于非SSVI基线,证明了自监督不变性机制的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。