Skip to main content
QUICK REVIEW

[论文解读] Large-scale Continuous Gesture Recognition Using Convolutional Neural Networks

Pichao Wang, Wanqing Li|arXiv (Cornell University)|Aug 22, 2016
Hand Gesture Recognition Systems参考文献 38被引用 11
一句话总结

该论文提出了一种仅使用深度图序列的深度学习方法,用于大规模连续手势识别。通过运动量(QOM)进行手势分割,构建改进的深度运动图(IDMM)以编码时空特征,并采用微调的卷积神经网络(ConvNets)进行分类,最终在ChaLearn LAP 2016挑战赛中取得0.2655的平均Jaccard指数,排名第三。

ABSTRACT

This paper addresses the problem of continuous gesture recognition from sequences of depth maps using convolutional neutral networks (ConvNets). The proposed method first segments individual gestures from a depth sequence based on quantity of movement (QOM). For each segmented gesture, an Improved Depth Motion Map (IDMM), which converts the depth sequence into one image, is constructed and fed to a ConvNet for recognition. The IDMM effectively encodes both spatial and temporal information and allows the fine-tuning with existing ConvNet models for classification without introducing millions of parameters to learn. The proposed method is evaluated on the Large-scale Continuous Gesture Recognition of the ChaLearn Looking at People (LAP) challenge 2016. It achieved the performance of 0.2655 (Mean Jaccard Index) and ranked $3^{rd}$ place in this challenge.

研究动机与目标

  • 解决在未受约束的深度序列中手势边界未知情况下的连续手势识别问题。
  • 开发一种对不完美手势分割不敏感的鲁棒分类框架。
  • 利用预训练的卷积神经网络实现高效特征学习,避免从零开始训练。
  • 仅使用深度数据实现高性能,避免依赖RGB或多模态输入。

提出的方法

  • 使用运动量(QOM)方法对手势序列进行分割,该方法基于运动强度识别潜在的手势边界。
  • 对每个分割后的手势,通过堆叠深度图差值构建改进的深度运动图(IDMM),将空间和时间动态编码为单张图像。
  • 将IDMM输入预训练的卷积神经网络进行特征提取与分类,实现迁移学习和参数效率。
  • 通过在IDMM表示上对现有卷积神经网络模型(如AlexNet)进行微调,实现对手势分类的适应,而无需训练数百万个新参数。
  • 在QOM处理过程中应用滑动窗口优化步骤,通过在每个窗口中选择QOM最小的帧来提升边界检测精度。
  • 按手势片段进行分类,识别性能通过所有测试序列上的Jaccard指数进行评估。

实验结果

研究问题

  • RQ1仅使用单模态深度数据的方法是否能在无RGB或多模态输入的情况下实现具有竞争力的连续手势识别性能?
  • RQ2IDMM表示在编码手势分类的时空动态方面有多高效?
  • RQ3预训练的卷积神经网络在IDMM上微调后,能在多大程度上实现高精度且仅需极少额外训练?
  • RQ4结合深度学习后,基于QOM的分割方法在端到端手势识别中的鲁棒性如何?

主要发现

  • 所提方法在ChaLearn LAP 2016挑战赛测试集上取得了0.2655的平均Jaccard指数,26支参赛队伍中排名第三。
  • 尽管仅使用深度数据,该方法仍优于使用RGB与深度双模态的基线方法(后者在测试集上仅取得0.1435的Jaccard指数)。
  • 该方法在验证集上取得了0.2403的平均Jaccard指数,显著优于基线MFSK方法(0.0918)和MFSK+DeepID方法(0.0902)。
  • 性能接近挑战赛中排名前两位的方法,后者使用了多模态输入(RGB与深度),表明深度单模态方法的有效性。
  • 计算成本适中,在配备Tesla K40的GPU工作站上,每条深度序列处理时间约为0.8秒。
  • 结果表明,IDMM与微调的卷积神经网络为大规模连续手势识别提供了一种强大、高效且可扩展的解决方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。