Skip to main content
QUICK REVIEW

[论文解读] Combining ConvNets with Hand-Crafted Features for Action Recognition Based on an HMM-SVM Classifier

Pichao Wang, Zhaoyang Li|arXiv (Cornell University)|Feb 1, 2016
Human Pose and Action Recognition参考文献 24被引用 4
一句话总结

该论文提出了一种新颖的RGB-D动作识别框架,通过结合基于骨架的手工特征与基于深度图的卷积神经网络(ConvNets)深度特征,利用IGMM进行分割,HMM-SVM进行时序建模。通过融合局部运动模式与全局序列建模,提升了鲁棒性,优于仅依赖深度学习或手工特征的方法。

ABSTRACT

This paper proposes a new framework for RGB-D-based action recognition that takes advantages of hand-designed features from skeleton data and deeply learned features from depth maps, and exploits effectively both the local and global temporal information. Specifically, depth and skeleton data are firstly augmented for deep learning and making the recognition insensitive to view variance. Secondly, depth sequences are segmented using the hand-crafted features based on skeleton joints motion histogram to exploit the local temporal information. All training se gments are clustered using an Infinite Gaussian Mixture Model (IGMM) through Bayesian estimation and labelled for training Convolutional Neural Networks (ConvNets) on the depth maps. Thus, a depth sequence can be reliably encoded into a sequence of segment labels. Finally, the sequence of labels is fed into a joint Hidden Markov Model and Support Vector Machine (HMM-SVM) classifier to explore the global temporal information for final recognition.

研究动机与目标

  • 解决纯深度学习模型在动作识别中对全局平移、旋转和缩放不敏感的局限性。
  • 利用手工骨架特征(如HOD)的不变性特性,实现鲁棒的局部时序建模。
  • 通过HMM-SVM有效结合ConvNets的局部时空特征与全局序列依赖关系。
  • 通过深度与骨架序列的数据增强,降低对视角变化的敏感性。
  • 利用基于骨架的运动直方图生成语义上合理的视频片段,以实现深度网络的可靠训练。

提出的方法

  • 基于骨架关节点运动直方图的手工特征对深度序列进行分割,以捕捉局部时序动态。
  • 使用贝叶斯估计的无限高斯混合模型(IGMM)对训练片段进行聚类,并分配标签用于ConvNet训练。
  • 通过堆叠运动能量并特殊处理第一帧,构建改进的深度运动图(DMMs),以保留初始姿态并增强时序对比度。
  • 使用彩虹变换对DMMs进行伪彩色编码,以提升ConvNet输入的可分性。
  • 在三个正交投影平面上的伪彩色DMMs上分别训练三个并行的ConvNets,并对输出进行平均以实现片段分类。
  • 将ConvNet预测的标签序列输入联合HMM-SVM分类器,其中HMM建模全局时序结构,SVM执行最终的判别分类。

实验结果

研究问题

  • RQ1将手工骨架特征与基于深度图的深度特征相结合,能否提升动作识别性能?
  • RQ2基于骨架特征的IGMM对深度序列进行分割,在多大程度上能增强局部时序建模?
  • RQ3与独立模型相比,HMM-SVM框架在多大程度上利用了动作序列中的全局时序依赖性?
  • RQ4DMM的伪彩色编码是否能提升ConvNets在动作识别中的判别能力?
  • RQ5对深度与骨架序列进行数据增强,能否降低动作识别中对视角变化的敏感性?

主要发现

  • 所提出的框架通过有效结合ConvNets的局部时空特征与HMM-SVM的全局序列建模,实现了卓越的性能。
  • 基于骨架的片段IGMM聚类能够实现训练数据的可靠标注,从而提升ConvNet的泛化能力。
  • 保留初始姿态并增强运动能量的改进DMMs,显著提升了对方向相反的相似动作(如挥手)的判别能力。
  • DMM的伪彩色编码显著提高了特征的可分性,如图2所示的视觉分离更加清晰。
  • HMM-SVM分类器优于独立的HMM或SVM,证明了时序结构与判别能力联合建模的优势。
  • 由于训练过程中对深度与骨架序列进行了数据增强,该框架对视角变化表现出鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。