[论文解读] Self-Supervised Video Transformers for Isolated Sign Language Recognition
本论文提出了一种用于孤立手语识别(ISLR)的自监督视频视觉变换器,结合掩码重建预训练(MaskFeat)与层次化视觉变换器,实现了最先进性能。在WLASL2000数据集上,采用MaskFeat预训练的MViTv2模型达到79.02%的top-1准确率,比基于姿态的方法和监督方法高出1.59%;线性探针分析表明,层次化架构更能捕捉手语的音位特征,如手形与动作。
This paper presents an in-depth analysis of various self-supervision methods for isolated sign language recognition (ISLR). We consider four recently introduced transformer-based approaches to self-supervised learning from videos, and four pre-training data regimes, and study all the combinations on the WLASL2000 dataset. Our findings reveal that MaskFeat achieves performance superior to pose-based and supervised video models, with a top-1 accuracy of 79.02% on gloss-based WLASL2000. Furthermore, we analyze these models' ability to produce representations of ASL signs using linear probing on diverse phonological features. This study underscores the value of architecture and pre-training task choices in ISLR. Specifically, our results on WLASL2000 highlight the power of masked reconstruction pre-training, and our linear probing results demonstrate the importance of hierarchical vision transformers for sign language representation.
研究动机与目标
- 评估自监督视频变换器在低数据环境下用于孤立手语识别(ISLR)的有效性。
- 探究不同预训练任务与架构对手语表征学习的影响。
- 基于Brentari的手语语调模型中的音位特征,分析模型表征。
- 在基于词素的WLASL2000基准上建立新的最先进水平。
提出的方法
- 使用四种自监督方法预训练视觉变换器:VideoMAE(像素重建)、MaskFeat(特征重建)、BEVT(类似BERT的视频预训练)和SVT(基于DINO的对比学习)。
- 在WLASL2000数据集上对预训练模型进行微调,采用线性探针和端到端训练进行基于词素的手语分类。
- 采用层次化视觉变换器架构(如MViTv2、VideoSwin),以更好地建模手语视频中的空间与时间层次结构。
- 通过线性探针在Brentari手语语调模型的15个音位特征上评估表征性能,包括手形、动作、对称性与位置等。
- 在两种预训练数据设置下进行训练:Kinetics400(动作视频)与WLASL2000(手语视频),或两者的组合。
- 通过逐层探针准确率分析,评估微调如何提升模型深层对语言特征的编码能力。
![Figure 1 : Sample frames from isolated sign language video extracted from the WLASL2000 dataset [ 19 ] .](https://ar5iv.labs.arxiv.org/html/2309.02450/assets/x1.png)
实验结果
研究问题
- RQ1在WLASL2000上,哪种自监督预训练任务能为ISLR带来最佳性能?
- RQ2不同视觉变换器架构(如普通ViT与层次化架构)如何影响手语表征质量?
- RQ3自监督模型在多大程度上能学习到手语中具有语言意义的特征,如手形与动作?
- RQ4在ISLR上进行微调是否能提升模型对音位特征的表征能力,即使这些特征未被显式训练?
- RQ5预训练期间的视频采样策略如何影响模型捕捉时间依赖特征(如手语动作)的能力?
主要发现
- 采用MaskFeat预训练的MViTv2在WLASL2000上达到79.02%的top-1准确率,创下新最先进水平,比此前基于姿态的最先进方法高出1.59%。
- 层次化视觉变换器(如BEVT、MaskFeat)在所有15个音位特征上的线性探针表现均优于普通ViT,表明其具有更优的语言表征学习能力。
- 在ISLR上进行微调能显著提升基于动作的特征(如路径动作)的线性探针准确率,尤其在采用稀疏采样策略预训练的模型中更为明显。
- 在连续手语视频(如Kinetics400)上预训练的模型因帧采样稀疏而难以捕捉时间依赖特征,但通过在短时单手语视频上微调可恢复性能。
- 逐层探针分析显示,微调使线性探针准确率在模型深层单调递增,表明语言特征编码能力得到提升。
- MaskFeat与BEVT在所有音位特征上的表现与I3D(强基线CNN)相当或更优,而VideoMAE与SVT在大多数特征上未能达到I3D的水平。
![Figure 2 : Sample frames extracted from ASL to English translation dataset OpenASL [ 32 ] .](https://ar5iv.labs.arxiv.org/html/2309.02450/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。