Skip to main content
QUICK REVIEW

[论文解读] Lexicon-Free Fingerspelling Recognition from Video: Data, Models, and Signer Adaptation

Tae-Hwan Kim, Jonathan Keane|arXiv (Cornell University)|Sep 26, 2016
Hand Gesture Recognition Systems参考文献 65被引用 3
一句话总结

本文提出了一种无需词典的美国手语手指拼写识别系统,基于新型多说话者视频数据集和基于深度学习的模型。该系统采用基于DNN特征的分段条件随机场(CRF),在说话人相关设置下达到92%的准确率,在多说话人设置下通过神经网络自适应技术实现83%的准确率,显著提升了跨说话人和录制条件下的鲁棒性识别性能。

ABSTRACT

We study the problem of recognizing video sequences of fingerspelled letters in American Sign Language (ASL). Fingerspelling comprises a significant but relatively understudied part of ASL. Recognizing fingerspelling is challenging for a number of reasons: It involves quick, small motions that are often highly coarticulated; it exhibits significant variation between signers; and there has been a dearth of continuous fingerspelling data collected. In this work we collect and annotate a new data set of continuous fingerspelling videos, compare several types of recognizers, and explore the problem of signer variation. Our best-performing models are segmental (semi-Markov) conditional random fields using deep neural network-based features. In the signer-dependent setting, our recognizers achieve up to about 92% letter accuracy. The multi-signer setting is much more challenging, but with neural network adaptation we achieve up to 83% letter accuracies in this setting.

研究动机与目标

  • 为解决在多种说话人之间因显著差异而带来的连续手指拼写识别挑战。
  • 收集并标注一个大规模新型多说话人连续手指拼写视频数据集,以支持鲁棒识别研究。
  • 开发并评估在签名风格和视频条件存在差异的情况下仍具泛化能力的深度学习模型。
  • 研究有效的自适应技术,以提升多说话人识别性能,超越仅针对特定说话人的模型。

提出的方法

  • 作者收集并标注了一个新型多说话人连续手指拼写视频数据集,包含真实分割结果和峰值手形标注。
  • 使用从视频帧中提取的深度神经网络(DNN)特征来表征手形和运动动态。
  • 采用分段(半马尔可夫)条件随机场(CRF)作为序列建模框架,用于识别字母序列。
  • 应用神经网络自适应技术,以提升多说话人设置下的泛化能力,降低从说话人相关到多说话人场景下的性能下降。
  • 将手指拼写的字母建模为离散手形,结合发音特征,以峰值手形帧作为识别目标。
  • 定义了一种基于关节角度(MCP、PIP)的语音学特征表示,以在不同说话人之间一致地描述手形。

实验结果

研究问题

  • RQ1在使用连续视频数据的情况下,无词典手指拼写识别在说话人相关和多说话人设置下的性能如何?
  • RQ2不同序列建模架构(如CRF与HMM)在识别连续手指拼写序列方面表现如何比较?
  • RQ3与说话人相关模型相比,神经网络自适应在多说话人识别中能在多大程度上缓解性能下降?
  • RQ4DNN特征在捕捉连续手指拼写中细微的共音化手形动态方面有多有效?
  • RQ5高质量、多说话人的视频标注在提升识别准确率和模型泛化能力方面起到何种作用?

主要发现

  • 在说话人相关设置下,最佳模型使用分段CRF与DNN特征,实现了92%的字母准确率。
  • 在更具挑战性的多说话人设置下,通过神经网络自适应技术,识别准确率最高达到83%。
  • 使用分段CRF显著优于HMM等简单模型,尤其在处理字母间共音化过渡方面表现更优。
  • DNN特征在捕捉精细手形动态方面至关重要,显著提升了跨说话人的鲁棒性。
  • 所提出的标注方案(包括峰值手形标注和语音学特征定义)有效支持了模型的一致且可靠的训练与评估。
  • 该新数据集虽相对于语音数据集规模较小,但目前是已知最大规模的非封闭词汇限制的多说话人连续手指拼写视频数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。