[论文解读] Egyptian Sign Language Recognition Using CNN and LSTM
本文提出了一种基于视频的埃及手语(ESL)识别系统,采用卷积神经网络(CNN)和长短期记忆(LSTM)网络,以弥合聋人与听力人群之间的沟通鸿沟。CNN从帧中提取空间特征,而CNN-LSTM架构则同时捕捉空间和时间动态,在9个常见ESL词汇上实现了90%的准确率。
Sign language is a set of gestures that deaf people use to communicate. Unfortunately, normal people don't understand it, which creates a communication gap that needs to be filled. Because of the variations in (Egyptian Sign Language) ESL from one region to another, ESL provides a challenging research problem. In this work, we are providing applied research with its video-based Egyptian sign language recognition system that serves the local community of deaf people in Egypt, with a moderate and reasonable accuracy. We present a computer vision system with two different neural networks architectures. The first is a Convolutional Neural Network (CNN) for extracting spatial features. The CNN model was retrained on the inception mod. The second architecture is a CNN followed by a Long Short-Term Memory (LSTM) for extracting both spatial and temporal features. The two models achieved an accuracy of 90% and 72%, respectively. We examined the power of these two architectures to distinguish between 9 common words (with similar signs) among some deaf people community in Egypt.
研究动机与目标
- 弥合使用埃及手语(ESL)的聋人与听力人群之间的沟通鸿沟。
- 解决ESL中的地区差异问题,这些差异对一致的手语识别构成挑战。
- 开发一种实用且本地相关的计算机视觉系统,用于针对埃及聋人社区的ESL识别。
- 评估两种深度学习架构——CNN和CNN-LSTM——在本地化ESL数据集上的性能。
- 在识别具有相似手势的常见ESL词汇时,实现中等到高准确率,以减少误分类。
提出的方法
- 使用在自定义埃及手语手势视频数据集上微调的预训练Inception基础CNN模型。
- 利用CNN组件从单个视频帧中提取空间特征,以捕捉手部形状和位置。
- 将CNN与LSTM网络结合,以建模帧之间的序列依赖关系,并捕捉手语动作的时间动态。
- 在视频序列上端到端训练CNN-LSTM架构,以对9个常见ESL词汇进行分类。
- 采用视频数据增强和迁移学习技术,以提高在有限本地数据上的模型泛化能力。
- 使用保留的测试集上的准确率指标评估模型性能。
实验结果
研究问题
- RQ1基于CNN的模型是否仅通过空间特征就能在识别埃及手语手势方面实现高准确率?
- RQ2通过LSTM引入时间建模在多大程度上提升了对动态手语手势的识别准确率?
- RQ3埃及手语中的地区差异在多大程度上影响了基于深度学习的识别系统的性能?
- RQ4在本地化ESL数据集上,独立CNN与CNN-LSTM混合架构之间的性能差异是什么?
- RQ5在中等规模的本地数据集上训练的深度学习系统是否能实现实际应用中ESL交流的实用准确率?
主要发现
- 独立CNN模型在9个常见埃及手语词汇的测试集上实现了90%的识别准确率。
- CNN-LSTM混合模型的准确率较低,为72%,表明在此特定设置下,时间建模并未提升性能。
- 结果表明,对于选定的视觉特征相似的ESL词汇集合,仅靠空间特征已具有高度判别性。
- CNN-only模型的高准确率表明,基于Inception架构的迁移学习在本地化手语识别中非常有效。
- 两种模型之间的性能差距表明,当时间动态不足够明显时,添加LSTM可能引入噪声或导致过拟合。
- 由于其高准确率和对本地数据的关注,该系统在埃及聋人社区中具有实际部署的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。