Skip to main content
QUICK REVIEW

[论文解读] Large-scale Isolated Gesture Recognition Using Convolutional Neural Networks

Pichao Wang, Wanqing Li|arXiv (Cornell University)|Jan 7, 2017
Hand Gesture Recognition Systems参考文献 32被引用 5
一句话总结

本文提出三种紧凑的、基于图像的表示方法——动态深度图(DDI)、动态深度法向图(DDNI)和动态深度运动法向图(DDMNI)——用于使用深度序列进行大规模独立手势识别。通过应用双向排序池化将序列转换为时空图像,该方法实现了仅使用深度数据对预训练卷积神经网络(ConvNets)进行微调,最终在 ChaLearn LAP 2016 挑战赛中取得 55.57% 的准确率,排名第二,尽管仅使用了深度模态。

ABSTRACT

This paper proposes three simple, compact yet effective representations of depth sequences, referred to respectively as Dynamic Depth Images (DDI), Dynamic Depth Normal Images (DDNI) and Dynamic Depth Motion Normal Images (DDMNI). These dynamic images are constructed from a sequence of depth maps using bidirectional rank pooling to effectively capture the spatial-temporal information. Such image-based representations enable us to fine-tune the existing ConvNets models trained on image data for classification of depth sequences, without introducing large parameters to learn. Upon the proposed representations, a convolutional Neural networks (ConvNets) based method is developed for gesture recognition and evaluated on the Large-scale Isolated Gesture Recognition at the ChaLearn Looking at People (LAP) challenge 2016. The method achieved 55.57\% classification accuracy and ranked $2^{nd}$ place in this challenge but was very close to the best performance even though we only used depth data.

研究动机与目标

  • 解决在训练数据有限的情况下,从深度序列中识别独立手势的挑战。
  • 开发紧凑且高效的深度序列图像化表示,以保留时空动态特性。
  • 实现在不从零开始训练大型网络的前提下,将基于图像的卷积神经网络迁移至深度序列分类任务。
  • 仅使用深度数据实现大规模手势识别的高准确率,避免依赖 RGB 或多模态输入。

提出的方法

  • 提出动态深度图(DDI)作为序列中深度图的简单平均,以捕捉整体姿态。
  • 通过在深度图上应用双向排序池化,引入动态深度法向图(DDNI),以编码空间与时间特征。
  • 通过在连续深度图差值上应用双向排序池化,开发动态深度运动法向图(DDMNI),以突出运动动态特性。
  • 使用双向排序池化在时间和空间维度上聚合特征,从深度序列生成紧凑且具有判别力的图像表示。
  • 在所构建的图像表示上微调预训练的卷积神经网络模型(如 AlexNet),而无需增加大量新参数。
  • 将标准卷积神经网络架构应用于图像化表示,实现对深度序列数据的高效训练与推理。

实验结果

研究问题

  • RQ1紧凑的、基于图像的表示能否有效编码深度序列中的空间姿态与时间运动,以实现手势识别?
  • RQ2在大规模手势识别任务中,微调于这些图像表示的预训练卷积神经网络,在性能上能否显著优于手工设计的特征方法?
  • RQ3在大规模独立手势识别任务中,仅使用深度数据的方法与多模态方法相比,性能表现如何?
  • RQ4双向排序池化能否有效捕捉深度序列中的时空动态,从而提升识别准确率?

主要发现

  • 所提方法在 ChaLearn LAP 2016 挑战赛测试集上实现了 55.57% 的识别准确率,整体排名第二。
  • 尽管仅使用深度数据,该方法的性能与使用深度和 RGB 双模态的冠军方法非常接近(55.57% vs. 56.90%)。
  • 该方法在测试集上显著优于基线方法,如 MFSK(24.19%)和 MFSK+DeepID(23.67%)。
  • 三种表示方法——DDI、DDNI 和 DDMNI——具有互补性,联合使用时显著提升了识别准确率,优于单独使用任一方法。
  • 通过在所提图像表示上微调预训练的卷积神经网络,实现了在有限训练数据(平均每类仅约 144 个视频片段)下的有效学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。