Skip to main content
QUICK REVIEW

[论文解读] Natural Language-Assisted Sign Language Recognition

Ronglai Zuo, Fangyun Wei|arXiv (Cornell University)|Mar 21, 2023
Hand Gesture Recognition Systems被引用 5
一句话总结

本文提出自然语言辅助的手语识别(NLA-SLR)框架,通过利用词汇的语义信息提升手语识别性能。该方法引入基于语义相似度的语言感知标签平滑与跨模态混合训练策略,增强特征可分性,在MSASL、WLASL和NMFs-CSL基准上取得最先进性能,WLASL2000上的top-1准确率达到61.05%。

ABSTRACT

Sign languages are visual languages which convey information by signers' handshape, facial expression, body movement, and so forth. Due to the inherent restriction of combinations of these visual ingredients, there exist a significant number of visually indistinguishable signs (VISigns) in sign languages, which limits the recognition capacity of vision neural networks. To mitigate the problem, we propose the Natural Language-Assisted Sign Language Recognition (NLA-SLR) framework, which exploits semantic information contained in glosses (sign labels). First, for VISigns with similar semantic meanings, we propose language-aware label smoothing by generating soft labels for each training sign whose smoothing weights are computed from the normalized semantic similarities among the glosses to ease training. Second, for VISigns with distinct semantic meanings, we present an inter-modality mixup technique which blends vision and gloss features to further maximize the separability of different signs under the supervision of blended labels. Besides, we also introduce a novel backbone, video-keypoint network, which not only models both RGB videos and human body keypoints but also derives knowledge from sign videos of different temporal receptive fields. Empirically, our method achieves state-of-the-art performance on three widely-adopted benchmarks: MSASL, WLASL, and NMFs-CSL. Codes are available at https://github.com/FangyunWei/SLRT.

研究动机与目标

  • 解决手语识别中视觉上难以区分的手势(VISigns)带来的挑战,此类手势限制了基于视觉模型的性能表现。
  • 利用具有语言意义的词汇标签(即带语义的符号标签)中的语义信息,提升识别性能,超越仅依赖视觉特征的局限。
  • 通过将语义相似度融入标签平滑策略,缓解视觉外观相似但语义不同的VISigns带来的训练困难。
  • 通过跨模态特征融合,最大化语义意义不同但视觉上相似的VISigns在潜在空间中的特征可分性。
  • 设计一种新型的视频关键点网络主干网络,融合RGB视频与人体关键点表征,并在多个时间感受野上实现知识蒸馏。

提出的方法

  • 提出语言感知标签平滑:利用fastText嵌入计算真实词汇与词典中所有其他词汇之间的语义相似度,生成软标签。
  • 应用跨模态混合训练:将手语视频的视觉特征与fastText生成的词汇特征进行混合,构建混合表示与标签,提升模型判别能力。
  • 设计一种联合建模RGB视频帧与人体关键点序列的视频关键点网络主干,结合多感受野知识蒸馏机制。
  • 在主分类器(FC1)之外引入辅助分类器(FC2),以传播语言信息并提升泛化能力,同时采用自适应损失加权策略,在训练后期优先考虑分类损失。
  • 采用两阶段训练策略:首先使用标准交叉熵损失训练主干网络与分类器,随后引入混合训练与标签平滑组件进行微调。
  • 使用fastText计算词汇之间的语义相似度,该相似度结果既用于标签平滑的平滑权重,也作为跨模态混合训练的依据。

实验结果

研究问题

  • RQ1词汇之间的语义相似度是否能提升视觉相似但语义不同的手势的训练稳定性和性能?
  • RQ2通过跨模态混合训练融合视觉与词汇特征,是否能增强潜在空间中手势表征的可分性?
  • RQ3在视觉外观相似但语义不同的VISigns上,语言感知标签平滑相较于标准标签平滑是否具有显著优势?
  • RQ4所提出的视频关键点网络主干相较于标准模型,在建模手语视频时空动态特性方面表现如何?
  • RQ5语言感知标签平滑与跨模态混合训练的结合是否能在不同类型VISigns(语义相似 vs. 语义不同)上均实现稳定性能提升?

主要发现

  • 语言感知标签平滑在所有测试平滑参数(ε = 0.1, 0.2, 0.3)下均优于基线标签平滑方法,WLASL2000上top-1准确率提升0.92%至1.24%。
  • 跨模态混合训练在所有基准上均使top-1准确率提升超过1%,在VS-S(视觉相似、语义相似)手势上增益最大,从50.50%提升至65.35%。
  • 语言感知标签平滑与跨模态混合训练的联合使用取得最佳整体性能,在WLASL2000上达到61.05%的top-1准确率,超越此前最先进方法。
  • 消融实验证实,辅助分类器与损失加权策略显著提升性能,主要增益来自双分类器的联合集成。
  • 该方法在语义不同但视觉相似的VISigns(VS-D)上实现显著性能提升,准确率从50.93%提升至56.07%,证明其在处理语义差异但视觉相似手势上的有效性。
  • 消融研究验证,视频关键点主干网络通过在不同时间感受野上有效建模RGB与关键点模态,显著提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。