Skip to main content
QUICK REVIEW

[论文解读] Fingerspelling recognition in the wild with iterative visual attention

Bowen Shi, Aurora Martinez Del Rio|arXiv (Cornell University)|Aug 28, 2019
Hand Gesture Recognition Systems参考文献 42被引用 4
一句话总结

本文提出一种端到端的迭代视觉注意力模型,用于在不受约束的真实世界视频中识别美国手语指拼,且无需依赖手部检测或分割。通过在多轮迭代中逐步聚焦于高分辨率感兴趣区域,该方法实现了最先进(SOTA)的识别准确率,显著优于以往方法,并在结合新收集的大规模众包数据集后,展现出对领域偏移的鲁棒性。

ABSTRACT

Sign language recognition is a challenging gesture sequence recognition problem, characterized by quick and highly coarticulated motion. In this paper we focus on recognition of fingerspelling sequences in American Sign Language (ASL) videos collected in the wild, mainly from YouTube and Deaf social media. Most previous work on sign language recognition has focused on controlled settings where the data is recorded in a studio environment and the number of signers is limited. Our work aims to address the challenges of real-life data, reducing the need for detection or segmentation modules commonly used in this domain. We propose an end-to-end model based on an iterative attention mechanism, without explicit hand detection or segmentation. Our approach dynamically focuses on increasingly high-resolution regions of interest. It outperforms prior work by a large margin. We also introduce a newly collected data set of crowdsourced annotations of fingerspelling in the wild, and show that performance can be further improved with this additional data set.

研究动机与目标

  • 解决在具有高运动模糊和复杂背景的真实世界非受限视频中识别指拼的挑战。
  • 消除对手部检测或分割模块的依赖,这些模块在非受控环境中容易出错。
  • 开发一种端到端模型,通过迭代注意力动态聚焦于高分辨率感兴趣区域。
  • 引入一个新收集的、大规模的、公开可用的众包数据集,涵盖来自YouTube和聋人社交媒体的指拼标注。
  • 证明迭代注意力显著提升了识别准确率,即使在结合外部手部检测器时,也优于以往方法。

提出的方法

  • 该模型采用一种迭代注意力机制,通过多轮逐步放大,聚焦于高分辨率的感兴趣区域,逐步精炼对手部的注意力。
  • 在每一轮迭代中,模型关注输入帧的一个裁剪区域,提高分辨率并减少背景干扰。
  • 注意力机制在原始视频帧上端到端训练,无需手部位置的显式监督。
  • 该方法结合面部检测器以初始化感兴趣区域,提升模型稳定性和性能。
  • 模型通过语言模型头进行训练,以建模手指拼写单词中的序列依赖关系。
  • 该方法在基准演播室数据集和一个新收集的更大规模的众包真实世界视频数据集上进行了评估。

实验结果

研究问题

  • RQ1端到端的基于注意力的模型是否能在无需手部检测或分割的情况下,在非受限视频中实现优于以往方法的指拼识别准确率?
  • RQ2与标准注意力或固定裁剪方法相比,迭代视觉注意力在准确率和计算效率方面表现如何?
  • RQ3大规模众包的真实世界指拼数据集在多大程度上提升了不同模型的识别性能?
  • RQ4该迭代注意力模型对面部检测错误的鲁棒性如何,而面部检测是真实世界系统中的常见组件?
  • RQ5注意力机制是否隐式学习到了准确的手部定位?其表现与独立训练的手部检测器相比如何?

主要发现

  • 所提出的迭代注意力模型在ChicagoFSWild测试集上实现了61.2%的字母准确率,显著优于之前最先进方法。
  • 即使在有手部检测器可用的情况下,该迭代注意力模型仍能带来显著的性能提升,表明其价值超越了检测本身。
  • 采用迭代注意力训练的模型在相同漏检率下,手部定位的平均IoU达到0.413,显著高于独立训练的手部检测器(0.223)。
  • 众包收集的ChicagoFSWild+数据集(包含55,856个训练序列)显著提升了所有测试模型的性能。
  • 该模型的推理时间高效,每帧平均仅65ms,适用于实时应用。
  • 人类在相同测试集上的表现范围为74.3%至86.1%,表明该任务仍具挑战性,且当前机器性能与人类仍有提升空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。