Skip to main content
QUICK REVIEW

[论文解读] Improving Sign Language Translation with Monolingual Data by Sign Back-Translation

Hao Zhou, Wengang Zhou|arXiv (Cornell University)|May 26, 2021
Hand Gesture Recognition Systems参考文献 50被引用 11
一句话总结

本文提出Sign Back-Translation(SignBT),一种通过两阶段流程利用单语文本数据提升手语翻译(SLT)性能的方法:首先进行文本到词素的翻译;然后通过拼接预先标注的手语特征片段,实现从词素到手语序列的生成。该方法在PHOENIX-2014T和新提出的CSL-Daily数据集上均显著提升了SLT性能,在PHOENIX-2014T上取得了2.6个BLEU-4点的提升,在CSL-Daily测试集上达到21.34的BLEU-4分数。

ABSTRACT

Despite existing pioneering works on sign language translation (SLT), there is a non-trivial obstacle, i.e., the limited quantity of parallel sign-text data. To tackle this parallel data bottleneck, we propose a sign back-translation (SignBT) approach, which incorporates massive spoken language texts into SLT training. With a text-to-gloss translation model, we first back-translate the monolingual text to its gloss sequence. Then, the paired sign sequence is generated by splicing pieces from an estimated gloss-to-sign bank at the feature level. Finally, the synthetic parallel data serves as a strong supplement for the end-to-end training of the encoder-decoder SLT framework. To promote the SLT research, we further contribute CSL-Daily, a large-scale continuous SLT dataset. It provides both spoken language translations and gloss-level annotations. The topic revolves around people's daily lives (e.g., travel, shopping, medical care), the most likely SLT application scenario. Extensive experimental results and analysis of SLT methods are reported on CSL-Daily. With the proposed sign back-translation method, we obtain a substantial improvement over previous state-of-the-art SLT methods.

研究动机与目标

  • 为解决手语翻译(SLT)中平行手语与文本数据严重匮乏的关键问题。
  • 探索利用大规模单语文本数据增强SLT训练的可行性。
  • 开发一种真实且有效的数据增强流程,弥合文本与手语视频之间的模态差异。
  • 建立一个新的大规模基准CSL-Daily,用于连续手语翻译,具备丰富的标注信息。
  • 证明通过Sign反向翻译生成的合成数据可显著提升SLT模型性能。

提出的方法

  • 设计了一个两阶段的Sign反向翻译流程:先进行文本到词素的翻译,再进行词素到手语序列的生成。
  • 使用在现有文本-词素对上训练的神经序列到序列模型执行文本到词素的翻译。
  • 通过在特征层面拼接来自词素-手语库的预分割手语特征片段,实现词素到手语的转换。
  • 采用基于CTC的手语到词素对齐网络执行手语分割,以在手语视频中精确定位词素边界。
  • 将合成数据对(单语文本,合成手语特征序列)用于微调端到端的编码器-解码器SLT模型。
  • 该方法将整个过程视为一个文本到文本的反向翻译问题,并引入序列拼接操作,避免直接生成视频。

实验结果

研究问题

  • RQ1单语文本数据能否被有效利用以提升手语翻译性能?
  • RQ2如何在不直接生成视频的前提下弥合文本与手语视频之间的模态差距?
  • RQ3通过Sign反向翻译生成的合成数据是否能提升SLT模型的鲁棒性与准确性?
  • RQ4合成数据的质量与数量如何影响SLT模型性能?
  • RQ5像CSL-Daily这样大规模、多样化且标注详尽的SLT基准,能否支持更有效且标准化的SLT方法评估?

主要发现

  • 所提出的SignBT方法在PHOENIX-2014T数据集上相比基线模型实现了2.6个BLEU-4点的性能提升。
  • 在CSL-Daily基准上,该方法在测试集上取得了21.34的BLEU-4分数,显著优于基线模型。
  • 随着合成数据量的增加,性能稳步提升,表明该方法具有良好的可扩展性。
  • 更高品质的合成数据——由更精确的文本到词素模型生成——能带来更好的SLT模型性能,证实了该方法对数据质量的敏感性。
  • 即使在输入为空白的最坏情况下,模型仍表现出微弱的性能增益,表明合成数据的贡献不仅限于简单的语言建模。
  • 该方法在不同词汇量下均表现有效,且在CSL-Daily上取得更大性能增益,该数据集在文本和手语两方面的词汇量均更大,表明在高复杂度场景下数据增强效果更显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。