[论文解读] Tackling Low-Resourced Sign Language Translation: UPC at WMT-SLT 22
本论文在WMT-SLT 2022挑战赛中提出了一种基于Fairseq的Transformer模型,用于手语翻译(SLT),重点是将瑞士德语手语(DSGS)视频翻译为德语文本。尽管尝试了词汇量、数据增强和在PHOENIX-14T上的预训练,该系统在测试集上的BLEU分数仅为0.50,虽比基线模型提高了0.38 BLEU,但仍表明性能极差,主要由于数据稀缺和任务复杂性所致。
This paper describes the system developed at the Universitat Politècnica de Catalunya for the Workshop on Machine Translation 2022 Sign Language Translation Task, in particular, for the sign-to-text direction. We use a Transformer model implemented with the Fairseq modeling toolkit. We have experimented with the vocabulary size, data augmentation techniques and pretraining the model with the PHOENIX-14T dataset. Our system obtains 0.50 BLEU score for the test set, improving the organizers' baseline by 0.38 BLEU. We remark the poor results for both the baseline and our system, and thus, the unreliability of our findings.
研究动机与目标
- 为解决在视频和文本数据有限情况下的低资源手语翻译(SLT)挑战。
- 评估词汇量、数据增强和在PHOENIX-14T上预训练在低资源SLT设置下的有效性。
- 使用广泛使用的自然语言处理工具Fairseq实现并基准测试Transformer模型,用于手语视频到文本的翻译。
- 研究FocusNews与SRF数据集之间领域差异对手写翻译性能的影响。
- 探索迁移学习和替代输入表示方法(如基于图的姿势建模)在SLT中的可行性。
提出的方法
- 使用Fairseq工具包实现了一个包含6层、8头、2048维前馈网络和512维嵌入大小的Transformer编码器-解码器架构。
- 以MediaPipe的3D关键点序列(x, y, z)作为输入,归一化至[0,1],并通过三次样条插值重采样至25 fps。
- 为每个数据集单独构建词汇表:由于SRF中句子数量更多,因此使用其德语字幕进行词汇构建。
- 对SRF数据集应用了数据增强以人工增加训练样本,但计算成本限制了大规模实验。
- 尝试使用PHOENIX-14T数据集进行预训练,但未观察到性能提升。
- 考虑了图神经网络(GNN)方法以更好地建模姿态图结构,但由于时间和资源限制未予实现。
实验结果
研究问题
- RQ1在低资源SLT设置中,增加词汇量是否能提升翻译质量?
- RQ2在数据有限的情况下,数据增强技术能否显著提升手语翻译的BLEU分数?
- RQ3在更大的相关SLT数据集(PHOENIX-14T)上进行预训练,是否能提升在WMT-SLT 2022测试集上的泛化能力?
- RQ4基线模型和本系统表现不佳,是否主要由于视频时长与唯一词汇量之比过低?
- RQ5替代输入表示方法(如用于姿态图的GNN或来自RGB视频的I3D特征)是否能优于标准的一维关键点序列?
主要发现
- 所提出的系统在测试集上取得了0.50的BLEU分数,相比组织方提供的基线模型提升了0.38 BLEU。
- 仅在FocusNews上训练的基线模型表现最佳,表明FocusNews与SRF之间存在领域差异,可能阻碍联合训练。
- 词汇量调整对测试性能无显著影响,表明数据质量与分布可能比词汇规模更为关键。
- 模型检查点平均未提升结果,暗示模型稳定性或优化动态并非主要瓶颈。
- BLEU分数极低(接近零)表明模型仅学习了最常见词汇,无法从手语视频输入中生成有意义的翻译。
- WMT-SLT 2022数据集中视频时长与唯一词汇量之比显著低于其他大型SLT基准(如How2Sign的4.93或PHOENIX-14T的3.67),表明任务复杂度更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。