Skip to main content
QUICK REVIEW

[论文解读] Application of Transfer Learning to Sign Language Recognition using an Inflated 3D Deep Convolutional Neural Network

Roman Töngi|arXiv (Cornell University)|Feb 25, 2021
Hand Gesture Recognition Systems参考文献 14被引用 4
一句话总结

本文采用迁移学习方法,利用膨胀3D卷积神经网络(I3D)对孤立手语识别(SLR)进行研究,先在大规模MS-ASL数据集上预训练美国手语,再在较小的德国手语(SIGNUM)数据集上微调。该方法相较于非迁移学习基线模型,准确率最高提升21%,在低数据量SLR场景中表现出显著有效性。

ABSTRACT

Sign language is the primary language for people with a hearing loss. Sign language recognition (SLR) is the automatic recognition of sign language, which represents a challenging problem for computers, though some progress has been made recently using deep learning. Huge amounts of data are generally required to train deep learning models. However, corresponding datasets are missing for the majority of sign languages. Transfer learning is a technique to utilize a related task with an abundance of data available to help solve a target task lacking sufficient data. Transfer learning has been applied highly successfully in computer vision and natural language processing. However, much less research has been conducted in the field of SLR. This paper investigates how effectively transfer learning can be applied to isolated SLR using an inflated 3D convolutional neural network as the deep learning architecture. Transfer learning is implemented by pre-training a network on the American Sign Language dataset MS-ASL and subsequently fine-tuning it separately on three different sizes of the German Sign Language dataset SIGNUM. The results of the experiments give clear empirical evidence that transfer learning can be effectively applied to isolated SLR. The accuracy performances of the networks applying transfer learning increased substantially by up to 21% as compared to the baseline models that were not pre-trained on the MS-ASL dataset.

研究动机与目标

  • 探究在标注数据稀缺的情况下,迁移学习在孤立手语识别(SLR)中的有效性。
  • 评估在大规模手语数据集(MS-ASL)上预训练是否能提升在较小目标数据集(SIGNUM)上进行德国手语识别的性能。
  • 评估将迁移学习应用于3D卷积神经网络(I3D)进行视频驱动SLR时对模型准确率的影响。
  • 确定迁移学习是否能够缓解手语识别任务中的数据稀缺问题。

提出的方法

  • 在包含大量美国手语视频序列的MS-ASL数据集上预训练一个膨胀3D卷积神经网络(I3D)。
  • 在SIGNUM数据集的三个不同子集大小上微调预训练的I3D模型,以代表不同规模的德国手语数据。
  • 采用标准的数据增强和训练协议,确保迁移学习与非迁移学习基线之间的公平比较。
  • 通过在ImageNet和MS-ASL上预训练的权重初始化I3D网络,再在SIGNUM上进行微调,实现迁移学习。
  • 采用交叉熵损失和随机梯度下降对I3D架构在目标SLR任务上进行端到端训练。
  • 通过在SIGNUM数据集不同数据配置下的测试集上的top-1准确率评估模型性能。

实验结果

研究问题

  • RQ1当训练数据有限时,迁移学习是否能显著提升孤立手语识别模型的性能?
  • RQ2在大规模手语数据集(MS-ASL)上预训练,对在较小目标数据集(SIGNUM)上微调的模型准确率有何影响?
  • RQ3在SLR中,迁移学习在多大程度上缩小了在丰富数据与有限数据上训练的模型之间的性能差距?
  • RQ4使用膨胀3D CNN架构是否能增强迁移学习在视频驱动手语识别中的有效性?

主要发现

  • 在MS-ASL上预训练后采用迁移学习,使准确率显著提升,在SIGNUM数据集上相较于非预训练基线模型最高提升21%。
  • 在SIGNUM数据集的较小子集上,性能提升最为明显,表明迁移学习能有效缓解数据稀缺问题。
  • 即使目标数据量有限,微调后的I3D模型仍能实现高准确率,证明迁移学习在低数据SLR场景中具有强鲁棒性。
  • 结果表明,将迁移学习应用于3D CNN进行视频驱动手语识别时效果极佳。
  • 预训练模型在不同数据规模下均表现出良好泛化能力,保持了稳定的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。