[论文解读] SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
SignVTCL 提出了一种多模态连续手语识别框架,通过结合视频、关键点和光流数据,并在词素和句子层面引入视觉-文本对比学习,增强了视觉表征。该方法在 Phoenix-2014、Phoenix-2014T 和 CSL-Daily 数据集上实现了最先进性能,将词错误率降低至 17.3%(开发集)和 17.6%(测试集)。
Sign language recognition (SLR) plays a vital role in facilitating communication for the hearing-impaired community. SLR is a weakly supervised task where entire videos are annotated with glosses, making it challenging to identify the corresponding gloss within a video segment. Recent studies indicate that the main bottleneck in SLR is the insufficient training caused by the limited availability of large-scale datasets. To address this challenge, we present SignVTCL, a multi-modal continuous sign language recognition framework enhanced by visual-textual contrastive learning, which leverages the full potential of multi-modal data and the generalization ability of language model. SignVTCL integrates multi-modal data (video, keypoints, and optical flow) simultaneously to train a unified visual backbone, thereby yielding more robust visual representations. Furthermore, SignVTCL contains a visual-textual alignment approach incorporating gloss-level and sentence-level alignment to ensure precise correspondence between visual features and glosses at the level of individual glosses and sentence. Experimental results conducted on three datasets, Phoenix-2014, Phoenix-2014T, and CSL-Daily, demonstrate that SignVTCL achieves state-of-the-art results compared with previous methods.
研究动机与目标
- 解决连续手语识别(CSLR)中大规模标注手语数据集有限的挑战。
- 通过在统一主干网络中融合视频、关键点和光流模态,提升视觉表征学习能力。
- 通过词素级和句子级视觉-文本对齐,利用自然语言监督增强模型泛化能力。
- 通过实现视觉片段与文本词素之间的细粒度对齐,克服手语识别中仅全视频词素被标注的弱监督特性。
- 通过整合多模态与对比学习,在多个基准上实现最先进性能。
提出的方法
- 将视频、2D 姿态关键点和光流三种模态整合到共享视觉主干网络中,以增强动态运动理解能力。
- 采用手语金字塔网络(SPN)在中间层生成辅助 CTC 损失,提升跨时间尺度的特征学习。
- 使用动态时间规整(DTW)实现词素级对齐损失,将视觉特征与单个词素匹配。
- 引入句子级对齐损失,强制视觉序列与完整句子嵌入之间的整体语义一致性。
- 通过在词素和句子层面优化视觉与文本嵌入之间的跨模态相似性,实施视觉-文本对比学习。
- 采用多头解码器结合 CTC 损失与辅助 SPN 监督,端到端训练弱标注手语视频数据。
实验结果
研究问题
- RQ1联合学习视频、关键点和光流模态是否能显著提升手语识别中的视觉表征质量?
- RQ2在词素层面的视觉-文本对比学习在将单个手语动作与对应文本词素对齐方面有多有效?
- RQ3句子层面的视觉-文本对齐在多大程度上提升了连续手语识别中的上下文理解与识别准确率?
- RQ4多模态数据与对比学习的整合是否能缓解手语识别中因大规模标注数据有限导致的性能下降?
- RQ5各模态(视频、关键点、光流)及训练损失组件对最终识别性能的相对贡献如何?
主要发现
- SignVTCL 在 Phoenix-2014 数据集的开发集上达到 17.3% 的词错误率(WER),测试集上为 17.6%,优于先前方法。
- 与仅使用单一模态相比,视频、关键点和光流编码器的融合在开发集上将 WER 降低 1.1%,测试集上降低 1.0%。
- 引入词素级对齐损失后,开发集上的 WER 从 18.3% 降低至 17.5%,证明其在细粒度对齐方面的有效性。
- 句子级对齐在开发集上实现 17.7% 的 WER,表明上下文建模能力得到提升。
- SPN 辅助损失与所有对齐损失的组合使 WER 降低至 17.3%(开发集)和 17.6%(测试集),证实各组件间的协同效应。
- 词素级相似度矩阵的可视化显示对角线区域高度集中,证实视觉与文本表征之间实现了有效对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。