Skip to main content
QUICK REVIEW

[论文解读] Learning Linear Dynamical Systems with High-Order Tensor Data for Skeleton based Action Recognition

Wenwen Ding, Kai Liu|arXiv (Cornell University)|Jan 14, 2017
Human Pose and Action Recognition参考文献 17被引用 3
一句话总结

该论文提出了一种广义线性动态系统(gLDS),将3D骨骼序列建模为高阶张量时间序列,保留时空结构并避免向量化引起的维数灾难问题。通过应用Tucker分解来估计gLDS参数,并将动作表示为Grassmann流形上的子空间,该方法在字典学习和稀疏编码的基础上,于MSR-Action3D(94.96%)、UCF-Kinect(96.48%)和Northwestern-UCLA Multiview(92.99%)数据集上实现了最先进(SOTA)的准确率。

ABSTRACT

In recent years, there has been renewed interest in developing methods for skeleton-based human action recognition. A skeleton sequence can be naturally represented as a high-order tensor time series. In this paper, we model and analyze tensor time series with Linear Dynamical System (LDS) which is the most common for encoding spatio-temporal time-series data in various disciplines dut to its relative simplicity and efficiency. However, the traditional LDS treats the latent and observation state at each frame of video as a column vector. Such a vector representation fails to take into account the curse of dimensionality as well as valuable structural information with human action. Considering this fact, we propose generalized Linear Dynamical System (gLDS) for modeling tensor observation in the time series and employ Tucker decomposition to estimate the LDS parameters as action descriptors. Therefore, an action can be represented as a subspace corresponding to a point on a Grassmann manifold. Then we perform classification using dictionary learning and sparse coding over Grassmann manifold. Experiments on MSR Action3D Dataset, UCF Kinect Dataset and Northwestern-UCLA Multiview Action3D Dataset demonstrate that our proposed method achieves superior performance to the state-of-the-art algorithms.

研究动机与目标

  • 为解决基于骨骼的动作识别中基于向量的表示方法在3D关节数据中无法保留结构和高阶依赖关系的局限性。
  • 将3D人体动作序列建模为高阶张量时间序列,以保持时空结构并缓解维数灾难问题。
  • 开发一种广义LDS(gLDS),通过多线性变换将传统LDS从向量状态扩展到张量状态。
  • 通过Tucker分解gLDS参数学习动作描述子,并将动作表示为Grassmann流形上的子空间,以提升动作识别准确率。
  • 利用Grassmann流形上的字典学习和稀疏编码,实现跨主体和跨视角动作识别的鲁棒性。

提出的方法

  • 将3D骨骼序列表示为n阶张量时间序列,其中每个骨骼帧为(n-1)阶张量,以保留空间结构。
  • 提出一种广义LDS(gLDS)模型,将潜在状态和观测状态均视为张量,使用多线性变换而非基于向量的投影。
  • 对张量时间序列的模式-n展开矩阵应用Tucker分解,以估计gLDS参数并提取主成分。
  • 从gLDS的可观测性矩阵中学习每个动作的子空间表示,将动作映射到Grassmann流形上的点。
  • 通过在Grassmann流形上进行字典学习和稀疏编码实现分类,以增强判别能力。
  • 使用一种新型学习算法(3RB)优化框架,其性能优于基线方法如2RB和LTBSVM。

实验结果

研究问题

  • RQ1将3D骨骼序列建模为高阶张量时间序列,是否能相比向量化表示提升动作识别性能?
  • RQ2在张量状态上运行的广义LDS(gLDS)是否能优于传统基于向量的LDS,更有效地捕捉时空动态?
  • RQ3对gLDS参数进行Tucker分解,是否能有效提取保留结构信息的判别性动作描述子?
  • RQ4基于Grassmann流形的字典学习与稀疏编码如何提升骨骼动作识别任务的分类准确率?
  • RQ5所提方法在多视角动作数据集中的跨主体和跨视角泛化能力如何?

主要发现

  • 在MSR-Action3D数据集上,所提gLDS方法在具有挑战性的留一主体交叉验证协议下达到94.96%的总准确率,优于先前的SOTA方法。
  • 在UCF-Kinect数据集上,该方法实现96.48%的整体准确率,分别比HOJ3D和LTBSVM高出7.98%和5.56%。
  • 在Northwestern-UCLA Multiview数据集的跨主体设置下,该方法达到92.99%的准确率,比MST-AOG高出10.8%,表明对主体差异具有强鲁棒性。
  • 在跨视角设置下,该方法达到74.6%的准确率,比MST-AOG高出1.3%,表明具备中等程度的视角不变性,尽管性能受限于仅依赖3D关节坐标。
  • 随着子空间维度增加至16,识别率持续上升,超过后噪声和类间混淆开始降低性能,表明信息与复杂性之间存在最优平衡点。
  • 混淆矩阵显示,大多数动作的分类准确率超过95%,错误主要出现在高度相似的动作之间,如“高举手挥动”与“接球”之间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。