Skip to main content
QUICK REVIEW

[论文解读] Bangla sign language recognition using concatenated BdSL network

Thasin Abedin, Khondokar S. S. Prottoy|arXiv (Cornell University)|Jul 25, 2021
Hand Gesture Recognition Systems被引用 8
一句话总结

本文提出了一种新颖的“串联BdSL网络”,通过将卷积神经网络(CNN)的视觉特征与姿态估计网络的手部关键点数据融合,实现对孟加拉手语(BdSL)的识别。该方法在测试集上达到了91.51%的准确率,表明引入手部姿势信息能显著提升对视觉上相似的BdSL符号的识别效果。

ABSTRACT

Sign language is the only medium of communication for the hearing impaired and the deaf and dumb community. Communication with the general mass is thus always a challenge for this minority group. Especially in Bangla sign language (BdSL), there are 38 alphabets with some having nearly identical symbols. As a result, in BdSL recognition, the posture of hand is an important factor in addition to visual features extracted from traditional Convolutional Neural Network (CNN). In this paper, a novel architecture "Concatenated BdSL Network" is proposed which consists of a CNN based image network and a pose estimation network. While the image network gets the visual features, the relative positions of hand keypoints are taken by the pose estimation network to obtain the additional features to deal with the complexity of the BdSL symbols. A score of 91.51% was achieved by this novel approach in test set and the effectiveness of the additional pose estimation network is suggested by the experimental results.

研究动机与目标

  • 解决仅依靠视觉特征难以区分视觉上相似的孟加拉手语(BdSL)字母的问题。
  • 克服传统基于CNN的方法在捕捉BdSL中关键手部姿势差异方面的局限性。
  • 将姿态估计与深度学习相结合,以提升复杂BdSL符号的识别准确率。
  • 设计一种混合架构,融合视觉与空间手部特征表示,以增强鲁棒性。
  • 验证额外的姿态基特征在减少视觉相似手语符号误分类方面的有效性。

提出的方法

  • 设计一种双分支神经网络架构:一个分支通过卷积神经网络(CNN)处理原始图像输入,以提取视觉特征。
  • 第二个分支使用姿态估计模型,从输入图像中检测并提取手部关键点的相对位置。
  • 将CNN与姿态估计网络的特征图进行拼接,形成统一的表示用于分类。
  • 使用包含38个不同字母的标注BdSL数据集,对串联网络进行端到端训练。
  • 采用标准的深度学习优化技术,包括反向传播和Softmax分类,以实现最终预测。
  • 利用关键点坐标作为结构先验,以提升对仅在手部姿势上存在细微差别的相似手语手势的判别能力。

实验结果

研究问题

  • RQ1姿态关键点数据的融合是否能提升对视觉上相似的孟加拉手语字母的识别准确率?
  • RQ2串联CNN与姿态估计网络在捕捉BdSL识别中视觉与结构手部特征方面的有效性如何?
  • RQ3与仅使用CNN的模型相比,手部关键点位置提供的额外空间特征在多大程度上减少了BdSL中的误分类?
  • RQ4所提出的架构是否在BdSL基准数据集上优于传统的基于CNN的方法?
  • RQ5姿态估计在提升复杂BdSL符号识别性能方面作出了多大贡献?

主要发现

  • 所提出的串联BdSL网络在测试集上达到了91.51%的准确率,表明其在BdSL识别任务中具有出色的表现。
  • 引入姿态估计特征显著提升了识别效果,尤其在视觉相似性较高的BdSL符号上表现突出。
  • 该模型有效捕捉了手部姿势的细微差异,而这些差异对于区分相似手势至关重要。
  • 视觉特征与关键点基特征的融合相比仅使用CNN的基线模型带来了可测量的性能提升。
  • 结果验证了结构化手部信息可与视觉特征互补,从而增强真实场景中手语识别的鲁棒性。
  • 该架构在孟加拉语地区聋哑人群体的辅助沟通系统中具有良好的部署前景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。