[论文解读] Zero-Shot Sign Language Recognition: Can Textual Data Uncover Sign Languages?
本文提出了零样本手语识别(ZSSLR),提出了一种利用手语词典中文本描述来识别未见手语类别的框架。通过使用3D-CNN和双向LSTM对身体和手部区域的时空特征进行建模,并利用兼容性函数将视觉嵌入与文本描述对齐,该方法在新的ASL-Text基准上实现了20.9%的top-1准确率,证明了使用文本数据进行零样本手语理解的可行性。
We introduce the problem of zero-shot sign language recognition (ZSSLR), where the goal is to leverage models learned over the seen sign class examples to recognize the instances of unseen signs. To this end, we propose to utilize the readily available descriptions in sign language dictionaries as an intermediate-level semantic representation for knowledge transfer. We introduce a new benchmark dataset called ASL-Text that consists of 250 sign language classes and their accompanying textual descriptions. Compared to the ZSL datasets in other domains (such as object recognition), our dataset consists of limited number of training examples for a large number of classes, which imposes a significant challenge. We propose a framework that operates over the body and hand regions by means of 3D-CNNs, and models longer temporal relationships via bidirectional LSTMs. By leveraging the descriptive text embeddings along with these spatio-temporal representations within a zero-shot learning framework, we show that textual data can indeed be useful in uncovering sign languages. We anticipate that the introduced approach and the accompanying dataset will provide a basis for further exploration of this new zero-shot learning problem.
研究动机与目标
- 为解决在无任何标注视觉训练样本的情况下识别手语类别这一挑战,该场景在实际部署中普遍存在。
- 探究是否可利用手语词典中现成的文本描述作为零样本手语识别的有效语义先验。
- 构建一个新的基准数据集ASL-Text,包含250个手语类别及其对应的文本定义,用于ZSSLR研究。
- 开发一个端到端可训练的框架,融合时空视觉表征与文本嵌入,实现零样本泛化。
- 评估不同RNN架构和特征融合策略在建模手语识别中长程时序依赖关系方面的有效性。
提出的方法
- 该框架使用3D卷积神经网络(3D-CNNs)从视频片段中提取时空特征,重点关注手部和全身区域。
- 采用双向长短期记忆(bi-LSTM)网络对视觉序列中的长程时序依赖关系进行建模。
- 利用预训练的词嵌入将来自Webster美国手语词典的文本描述嵌入,形成手语类别的语义表征。
- 通过学习一个兼容性函数,将视觉嵌入映射到文本嵌入空间,从而通过最近邻搜索实现零样本预测。
- 使用对比损失端到端训练模型,以对齐视觉特征与其对应的文本描述。
- 通过在bi-LSTM层之前拼接手部和身体流的表征实现特征融合,增强判别能力。
实验结果
研究问题
- RQ1手语词典中的文本描述是否能有效作为识别未见手语类别的语义先验?
- RQ23D-CNN + bi-LSTM架构在建模手语视频的时空动态方面,对零样本识别的效用如何?
- RQ3同时结合手部和身体区域特征是否相比仅使用单一模态能提升零样本手语识别性能?
- RQ4不同RNN架构(LSTM、GRU、bi-LSTM)对零样本识别框架性能有何影响?
- RQ5文本描述的质量在多大程度上影响ZSSLR模型的泛化能力?
主要发现
- 所提出的框架在ASL-Text基准上实现了20.9%的top-1归一化准确率和51.4%的top-5归一化准确率,显著优于随机基线(分别为2.0%和10.0%)。
- 在RNN变体中,双向LSTM表现最佳,top-1准确率为20.9%,top-5准确率为51.4%。
- 融合手部和身体区域特征相比仅使用单一模态能提升性能,联合流实现20.9%的top-1准确率。
- 当使用LLE(局部线性嵌入)进行特征降维时,模型表现最佳,优于平均池化和其他基线方法。
- 错误预测通常源于手语描述之间较高的语义或视觉相似性,表明需要更细粒度的表征学习。
- 本研究证明,专家标注词典中的文本数据可作为零样本手语识别中可行且有效的知识来源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。