Skip to main content
QUICK REVIEW

[论文解读] Learning to recognize touch gestures: recurrent vs. convolutional features and dynamic sampling

Quentin Debard, Christian Wolf|arXiv (Cornell University)|Feb 19, 2018
Hand Gesture Recognition Systems参考文献 33被引用 15
一句话总结

本文提出了一种用于多点触控手势识别的深度学习方法,通过动态采样将可变长度的触控序列转换为固定长度、拓扑结构保持不变的表示形式,再利用一维卷积神经网络进行分类。该方法优于循环神经网络模型和当前最先进方法,在MMG数据集上达到99.38%的准确率,在留一法评估下达到98.62%。

ABSTRACT

We propose a fully automatic method for learning gestures on big touch devices in a potentially multi-user context. The goal is to learn general models capable of adapting to different gestures, user styles and hardware variations (e.g. device sizes, sampling frequencies and regularities). Based on deep neural networks, our method features a novel dynamic sampling and temporal normalization component, transforming variable length gestures into fixed length representations while preserving finger/surface contact transitions, that is, the topology of the signal. This sequential representation is then processed with a convolutional model capable, unlike recurrent networks, of learning hierarchical representations with different levels of abstraction. To demonstrate the interest of the proposed method, we introduce a new touch gestures dataset with 6591 gestures performed by 27 people, which is, up to our knowledge, the first of its kind: a publicly available multi-touch gesture dataset for interaction. We also tested our method on a standard dataset of symbolic touch gesture recognition, the MMG dataset, outperforming the state of the art and reporting close to perfect performance.

研究动机与目标

  • 开发一种完全自动化的手势识别系统,能够适应多样的用户风格、设备差异和多用户场景。
  • 解决因采样频率不一致和硬件配置差异导致的可变长度触控序列问题。
  • 通过直接从原始触控数据学习,消除对预定义手势协议的依赖,从而减轻用户负担。
  • 通过高效的模型设计和输入处理,实现实时推理。
  • 引入一个全新的、公开可用的多点触控手势数据集,用于基于交互的手势识别,填补现有基准中的空白。

提出的方法

  • 提出一种新颖的动态采样技术,通过自适应重采样将输入序列转换为固定长度表示,从而保留关键的瞬态变化(如手指触碰/释放)。
  • 应用时间归一化对不同长度的序列进行对齐,同时保持触控事件的拓扑结构。
  • 使用一维卷积神经网络(CNN)从固定长度输入中学习分层的空间-时间特征,实现多层次抽象。
  • 采用两阶段架构:首先,动态采样将原始触控序列转换;其次,CNN对归一化后的序列进行分类处理。
  • 通过调整特征图数量和网络深度来优化模型容量,并在不同参数量下比较性能表现。
  • 通过在一维卷积上处理单笔轨迹,并利用空间梯度阈值检测几何过渡(如拐角),将模型适配于符号化手势识别。

实验结果

研究问题

  • RQ1卷积神经网络是否能在保持时间拓扑结构的前提下,优于循环网络对可变长度触控手势序列进行分类?
  • RQ2动态采样在减少序列长度的同时,对保留关键触控过渡(如接触/断开)的效率如何?
  • RQ3单一通用模型在无需用户定义协议的情况下,能在多大程度上泛化于多样化的用户、设备和手势风格?
  • RQ4所提方法是否能在标准符号化手势基准(如MMG)上实现接近完美的性能,超越现有最先进水平?
  • RQ5该模型的运行时效率如何?是否可在CPU或嵌入式系统上实现实时部署?

主要发现

  • 尽管参数量更少(446,983个参数),该卷积模型在所提出数据集上达到89.96%的准确率,显著优于4层堆叠LSTM模型(73.65%)。
  • 在MMG数据集上,该方法在用户无关评估下达到99.38%的准确率,超越此前最先进水平(98.0%)。
  • 在MMG数据集的留一法评估中,准确率达到98.62%,证实了其在用户间的强泛化能力。
  • 在GPU上单个手势的测试仅需1.5 ms,在CPU上仅需5 ms,证明了其出色的实时可行性。
  • 动态采样方法有效缩短了输入序列长度,同时保留了关键信号过渡,从而实现了稳定且准确的分类。
  • 消融实验表明,CNN与RNN模型之间的性能差距并非源于参数量,而是由于CNN能够学习分层表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。