Skip to main content
QUICK REVIEW

[论文解读] IPN Hand: A Video Dataset and Benchmark for Real-Time Continuous Hand Gesture Recognition

Gibran Benítez-García, Jesús Olivares-Mercado|arXiv (Cornell University)|Apr 20, 2020
Hand Gesture Recognition Systems参考文献 29被引用 13
一句话总结

本论文提出IPN Hand,一个大规模、真实世界视频数据集,包含4,000多个手势样本和800,000帧RGB图像,来自50名受试者,旨在用于基准测试实时连续手势识别。该研究评估了基于RGB、光流和语义分割模态的3D-CNN模型,结果表明,与仅使用RGB相比,RGB+语义分割可将识别准确率提升高达10%,同时保持实时推理性能,使其成为具有挑战性的自然场景手势识别场景下稳健的基准。

ABSTRACT

In this paper, we introduce a new benchmark dataset named IPN Hand with sufficient size, variety, and real-world elements able to train and evaluate deep neural networks. This dataset contains more than 4,000 gesture samples and 800,000 RGB frames from 50 distinct subjects. We design 13 different static and dynamic gestures focused on interaction with touchless screens. We especially consider the scenario when continuous gestures are performed without transition states, and when subjects perform natural movements with their hands as non-gesture actions. Gestures were collected from about 30 diverse scenes, with real-world variation in background and illumination. With our dataset, the performance of three 3D-CNN models is evaluated on the tasks of isolated and continuous real-time HGR. Furthermore, we analyze the possibility of increasing the recognition accuracy by adding multiple modalities derived from RGB frames, i.e., optical flow and semantic segmentation, while keeping the real-time performance of the 3D-CNN model. Our empirical study also provides a comparison with the publicly available nvGesture (NVIDIA) dataset. The experimental results show that the state-of-the-art ResNext-101 model decreases about 30% accuracy when using our real-world dataset, demonstrating that the IPN Hand dataset can be used as a benchmark, and may help the community to step forward in the continuous HGR. Our dataset and pre-trained models used in the evaluation are publicly available at https://github.com/GibranBenitez/IPN-hand.

研究动机与目标

  • 为解决公开可用数据集缺乏真实模拟连续手势识别(HGR)中现实挑战的问题,例如无过渡状态的连续手势和自然的手部运动。
  • 构建一个大规模、多样化的数据集,涵盖光照、背景和场景复杂度的真实世界变化,以更好地训练和评估用于HGR的深度学习模型。
  • 评估多模态融合(特别是RGB与语义分割)相较于传统RGB+光流或RGB+深度的实时HGR有效性。
  • 建立一个反映真实世界性能的基准,尤其在类内可变性和无中立状态的连续手势输入条件下。

提出的方法

  • IPN Hand数据集从50名受试者收集,他们在约30个真实场景中执行13种静态和动态手势,涵盖不同光照、背景和动态环境。
  • 数据集包含无过渡状态的连续手势序列以及非手势的自然手部运动,模拟真实的无接触交互场景。
  • 使用RGB、光流和语义分割模态,对三种最先进的3D-CNN模型(ResNet-50、ResNeXt-101和ResLight-10)在孤立和连续HGR任务上进行训练与评估。
  • 采用分层双模型方法:轻量级检测器(ResLight-10)用于手势/非手势分类,随后由分类器(ResNet-50或ResNeXt-101)进行手势类别预测。
  • 探索RGB与语义分割的数据级融合,作为替代光流或深度的方法,旨在提升准确率而不牺牲实时性能。
  • 使用Levenshtein距离衡量连续手势识别的序列级准确率,同时通过二分类准确率和混淆矩阵评估检测器性能。

实验结果

研究问题

  • RQ1一个包含连续手势和自然手部运动的大规模真实世界数据集,是否能显著提升深度学习模型在连续HGR中的鲁棒性?
  • RQ2将语义分割作为模态与光流或深度相比,在提升实时HGR识别准确率方面表现如何?
  • RQ3手势持续时间的类内可变性以及真实场景变化在多大程度上影响3D-CNN模型在连续HGR中的性能?
  • RQ4所提出的IPN Hand数据集能否作为评估和推进实时连续HGR系统发展的可靠基准?

主要发现

  • 与更简单的基准相比,IPN Hand数据集使最先进的模型(如ResNeXt-101)的准确率下降约30%,充分体现了其真实性和挑战性。
  • 引入语义分割模态后,Levenshtein准确率相比仅使用RGB提升高达10%;ResNeXt-101模型在使用RGB+seg时达到39.01%的准确率,而仅使用RGB时为25.34%。
  • RGB+语义分割融合的准确率优于RGB+光流(42.47%),同时推理时间更低(39.9 ms vs. 53.7 ms),因此更适用于实时系统。
  • ResLight-10检测器在使用RGB+flow时准确率达82.43%,使用RGB+seg时为80.06%,显著优于仅使用RGB的基线(75.4%),尤其在检测非手势帧方面表现更优。
  • 混淆矩阵显示,仅使用RGB的模型将85%的非手势帧错误分类,而多模态模型显著降低了此类错误。
  • 采用ResNet-50与RGB+seg的分层双模型方法,Levenshtein准确率达到33.27%,总推理时间为29.2 ms,展现出准确率与速度之间的良好平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。