Skip to main content
QUICK REVIEW

[论文解读] American Sign Language Alphabet Recognition using Deep Learning

Nikhil Kasukurthi, Brij Rokad|arXiv (Cornell University)|May 14, 2019
Hand Gesture Recognition Systems参考文献 12被引用 15
一句话总结

本文提出了一种基于 SqueezeNet 的轻量化深度学习模型,用于从单张 RGB 图像中识别美国手语(ASL)字母表,准确率达到 83.29%。该方法使用预处理后的 RGB 图像,专为移动设备部署优化,提供了一种无需昂贵 3D 深度传感器的实时手语识别实用解决方案。

ABSTRACT

Tremendous headway has been made in the field of 3D hand pose estimation but the 3D depth cameras are usually inaccessible. We propose a model to recognize American Sign Language alphabet from RGB images. Images for the training were resized and pre-processed before training the Deep Neural Network. The model was trained on a squeezenet architecture to make it capable of running on mobile devices with an accuracy of 83.29%.

研究动机与目标

  • 开发一种轻量化深度学习模型,用于从标准 RGB 图像中识别 ASL 字母表。
  • 克服 3D 深度摄像头在实际部署中常因不可及或不切实际而带来的局限性。
  • 仅使用 RGB 输入实现实时、兼容移动设备的手语识别。
  • 在保持低计算成本的同时实现高准确率,以支持边缘设备部署。
  • 为手语识别辅助技术提供一种实用且可访问的解决方案。

提出的方法

  • 作者使用预训练的 SqueezeNet 架构以降低模型复杂度并提升推理速度。
  • 输入的 RGB 图像经过缩放和预处理,以标准化尺寸并增强特征提取。
  • 通过迁移学习技术,在自定义的 ASL 字母图像数据集上对模型进行微调。
  • 在最后一层应用 Softmax 分类器,以预测 26 个 ASL 字母中的一个。
  • 通过模型压缩和参数效率优化,使网络适用于移动设备部署。
  • 训练采用标准交叉熵损失函数和随机梯度下降法。

实验结果

研究问题

  • RQ1轻量化深度学习模型是否能仅使用 RGB 图像在识别 ASL 字母表任务中实现高准确率?
  • RQ2基于 SqueezeNet 的模型在此任务中与其它网络架构相比性能如何?
  • RQ3在 ASL 识别中,基于 RGB 图像的模型在多大程度上可替代 3D 深度传感器?
  • RQ4在移动设备部署中,模型准确率与计算效率之间存在何种权衡?
  • RQ5预处理和迁移学习是否能显著提升在有限数据集上的识别性能?

主要发现

  • 所提出的模型在仅使用 RGB 图像的 ASL 字母识别任务中实现了 83.29% 的准确率。
  • 基于 SqueezeNet 的架构实现了高效推理,使其适用于移动设备部署。
  • 该模型表明,无需 3D 深度数据即可实现高准确率,从而降低了硬件需求。
  • 输入图像的预处理有助于提升特征学习能力和模型泛化性能。
  • 迁移学习与微调的使用显著提升了在有限 ASL 数据集上的性能表现。
  • 该模型保持了计算效率,参数量小,支持在边缘设备上实现实时推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。