[论文解读] Clean Text and Full-Body Transformer: Microsoft's Submission to the WMT22 Shared Task on Sign Language Translation
本论文展示了微软在WMT22多语种手语翻译共享任务中的参赛作品,利用预训练I3D模型提取的全身视频特征以及经过清洗的文本流程,在瑞士德语手语到口语翻译任务中取得了最高的BLEU分数(0.6)和第一名的人工评估结果。通过引入唇读特征和词典数据集,该系统在开发集上的BLEU分数进一步提升至1.08,证明了多模态输入与数据清洗在低资源手语翻译中的有效性。
This paper describes Microsoft's submission to the first shared task on sign language translation at WMT 2022, a public competition tackling sign language to spoken language translation for Swiss German sign language. The task is very challenging due to data scarcity and an unprecedented vocabulary size of more than 20k words on the target side. Moreover, the data is taken from real broadcast news, includes native signing and covers scenarios of long videos. Motivated by recent advances in action recognition, we incorporate full body information by extracting features from a pre-trained I3D model and applying a standard transformer network. The accuracy of the system is further improved by applying careful data cleaning on the target text. We obtain BLEU scores of 0.6 and 0.78 on the test and dev set respectively, which is the best score among the participants of the shared task. Also in the human evaluation the submission reaches the first place. The BLEU score is further improved to 1.08 on the dev set by applying features extracted from a lip reading model.
研究动机与目标
- 为解决在真实世界、低资源环境下手语到口语翻译的挑战,特别是面对高词汇多样性的问题。
- 通过使用预训练I3D模型提取的全身视频表征,提升翻译性能。
- 通过系统性的文本清洗与词典数据集整合,提升模型泛化能力与准确性。
- 评估多模态输入(特别是全身动作与唇读特征)对手语翻译质量的影响。
提出的方法
- 使用预训练的I3D模型提取视频嵌入,从视频帧中编码全身手语动作。
- 采用标准的Transformer解码器架构,从I3D嵌入序列生成口语翻译。
- 进行广泛的文本预处理,以减少词汇量与罕见词数量,提升模型泛化能力与训练效率。
- 整合预训练的AV-HuBERT唇读模型,从面部口部区域提取互补视觉特征,提升对低频词与功能词的识别能力。
- 将全身动作与唇读特征融合为联合输入表征,以改善序列建模与翻译准确性。
- 引入公开的手语词典(SignSuisse),增强高频功能词的表征能力,这些词在基线模型中预测效果较差。
实验结果
研究问题
- RQ1预训练I3D模型提取的全身视频特征是否能在低资源环境下显著提升手语翻译性能?
- RQ2文本清洗在多大程度上能减少词汇量并提升手语翻译系统的BLEU分数?
- RQ3AV-HuBERT提取的唇读特征在提升手语翻译中对罕见词或功能词的识别能力方面有多有效?
- RQ4整合词典数据集是否能增强模型对高频、低歧义手语符号的预测能力,而这些符号常被端到端模型忽略?
- RQ5WMT22共享任务的性能指标与PHOENIX-2014T等基准相比如何?这说明了该任务的难度如何?
主要发现
- 该系统在WMT2022官方测试集上取得了0.6的BLEU分数,是所有7名参赛者中的最高分。
- 人工评估结果排名第一,证实了其生成翻译在自然度与流畅度方面的优异表现。
- 在开发集上,加入AV-HuBERT的唇读特征后,BLEU分数从仅使用I3D的0.78提升至1.08。
- 词典数据集的整合进一步提升了性能,尤其体现在对功能词如'auf wiedersehen'的预测能力,这些词在之前模型中表现不佳。
- 使用WMT数据集训练的模型在PHOENIX-2014T上的表现显著低于当前最先进模型,表明由于数据质量与领域限制,WMT22任务更具挑战性。
- PHOENIX-2014T数据中存在句末句号导致BLEU分数相对提升了1%,凸显了BLEU对标点与格式的敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。