[论文解读] Better Sign Language Translation with STMC-Transformer
本文提出 STMC-Transformer,一种新型神经机器翻译模型,通过直接执行视频到文本的翻译,绕过基于词汇的中间表示,实现了手语翻译的最先进性能。其在无需使用真实词汇(ground-truth glosses)的情况下,直接进行视频到文本翻译,性能优于基于词汇的翻译方法以及使用真实词汇的视频到文本翻译,挑战了‘词汇构成性能上限’的假设,揭示了词汇作为手语表示方式的低效性。
Sign Language Translation (SLT) first uses a Sign Language Recognition (SLR) system to extract sign language glosses from videos. Then, a translation system generates spoken language translations from the sign language glosses. This paper focuses on the translation system and introduces the STMC-Transformer which improves on the current state-of-the-art by over 5 and 7 BLEU respectively on gloss-to-text and video-to-text translation of the PHOENIX-Weather 2014T dataset. On the ASLG-PC12 corpus, we report an increase of over 16 BLEU. We also demonstrate the problem in current methods that rely on gloss supervision. The video-to-text translation of our STMC-Transformer outperforms translation of GT glosses. This contradicts previous claims that GT gloss translation acts as an upper bound for SLT performance and reveals that glosses are an inefficient representation of sign language. For future SLT research, we therefore suggest an end-to-end training of the recognition and translation models, or using a different sign language annotation scheme.
研究动机与目标
- 解决尽管手语识别(SLR)技术取得进展,但手语翻译(SLT)系统仍缺乏进展的问题,尤其聚焦于改进翻译模块。
- 挑战当前普遍认为真实词汇(GT gloss)翻译是 SLT 性能上限的假设,即认为词汇是最佳中间表示。
- 证明基于 Transformer 的模型直接从视频输入进行端到端训练,可超越从真实词汇翻译的性能,表明词汇引入了信息损失。
- 提出未来方向:联合训练识别与翻译模型,或采用替代标注方案,以进一步提升 SLT 性能。
提出的方法
- 提出 STMC-Transformer,一种针对手语翻译微调的序列到序列 Transformer 模型,利用自注意力机制建模手语序列中的长距离依赖关系。
- 应用权重共享、迁移学习和集成学习技术,以提升模型在低资源手语翻译任务中的泛化能力与性能。
- 在视频输入上端到端训练模型,采用手语视频的时间编码,避免依赖中间词汇表示。
- 在解码过程中使用多头交叉注意力机制,同时关注视觉特征与语言上下文,实现手语视频与目标语言输出之间的更好对齐。
- 采用带标签平滑的交叉熵损失和学习率调度衰减策略优化模型,以稳定训练过程并提升泛化能力。
- 在两个基准数据集——PHOENIX-Weather 2014T 和 ASLG-PC12 上评估模型,与基于词汇到文本及视频到文本的基线方法进行比较。
实验结果
研究问题
- RQ1当模型直接在视频输入上进行训练且不依赖词汇时,基于 Transformer 的模型是否能超越现有手语翻译方法?
- RQ2使用真实词汇是否真正代表了视频到文本手语翻译性能的上限?
- RQ3由于词汇以一维、逐词对应的方式表示多维语言,其在手语翻译中在多大程度上造成了信息瓶颈?
- RQ4当首次应用于 SLT 任务时,权重共享、迁移学习和集成学习等技术是否能显著提升手语翻译性能?
- RQ5与使用词汇监督的联合训练相比,识别与翻译模型的端到端联合训练是否更具有效性?
主要发现
- 在 PHOENIX-Weather 2014T 数据集上,STMC-Transformer 在视频到文本翻译任务中达到 38.7 的 BLEU 分数,比之前最先进方法高出超过 7 个 BLEU 点。
- 在同一数据集上,模型在基于词汇到文本的翻译任务中达到 32.1 的 BLEU 分数,比先前最先进方法高出超过 5 个 BLEU 点。
- 在 ASLG-PC12 数据集上,STMC-Transformer 相较于先前方法,BLEU 分数提升超过 16 分,展现出在不同数据集间的强大泛化能力。
- 在视频到文本翻译任务中,该模型性能优于从真实词汇翻译的结果,BLEU 分数为 38.7,而真实词汇翻译仅为 31.0,与‘真实词汇为性能上限’的假设相矛盾。
- 定性分析表明,即使在真实词汇与视频完全对齐的情况下,该模型生成的翻译仍比基于真实词汇的翻译更流畅、更准确。
- 结果表明,由于词汇对多维语言线索(如面部表情和空间运动)的编码具有损失性且为一维形式,因此其本身是手语的内在次优表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。