Skip to main content
QUICK REVIEW

[论文解读] Data Augmentation for Sign Language Gloss Translation

Amit Moryossef, Kayo Yin|arXiv (Cornell University)|May 16, 2021
Natural Language Processing Techniques参考文献 25被引用 5
一句话总结

本文提出一种基于规则的数据增强方法,用于手语词素到文本的翻译,利用手语与口语之间词汇重叠度高但句法差异大的特点。通过使用语法感知的重排启发式方法,从单语口语文本生成合成的词素-文本对,该方法在低资源设置下将ASL到英语和DGS到德语的翻译BLEU分数分别提升了最多3.14和2.20,优于回译和基线模型。

ABSTRACT

Sign language translation (SLT) is often decomposed into video-to-gloss recognition and gloss-to-text translation, where a gloss is a sequence of transcribed spoken-language words in the order in which they are signed. We focus here on gloss-to-text translation, which we treat as a low-resource neural machine translation (NMT) problem. However, unlike traditional low-resource NMT, gloss-to-text translation differs because gloss-text pairs often have a higher lexical overlap and lower syntactic overlap than pairs of spoken languages. We exploit this lexical overlap and handle syntactic divergence by proposing two rule-based heuristics that generate pseudo-parallel gloss-text pairs from monolingual spoken language text. By pre-training on the thus obtained synthetic data, we improve translation from American Sign Language (ASL) to English and German Sign Language (DGS) to German by up to 3.14 and 2.20 BLEU, respectively.

研究动机与目标

  • 为解决手语翻译中并行词素-文本数据极度稀缺的问题。
  • 探究是否可以有效利用单语口语数据来增强低资源手语翻译。
  • 开发基于规则的启发式方法,以利用手语与口语之间的词汇相似性和句法差异。
  • 评估合成数据在提升零样本和微调翻译性能方面的有效性。
  • 证明在极端低资源手语设置下,回译方法是无效的。

提出的方法

  • 提出两种基于规则的启发式方法:通用型和特定型,用于从单语口语文本生成伪并行词素-文本对。
  • 通用规则通过随机词序置换生成多样化的句法变体,同时保持词汇内容不变。
  • 特定规则针对目标语言(如德语)定制,基于该语言特有的词序模式应用句法转换。
  • 在真实并行数据上进行零样本评估或微调前,先在合成数据上进行预训练。
  • 使用BPE分词,子词单元数为2,000,以提高效率并处理未登录词。
  • 使用SacreBLEU和COMET评估模型,对比基线、回译和增强方法在两个数据集上的表现。

实验结果

研究问题

  • RQ1能否通过使用单语口语数据进行基于规则的数据增强,来提升低资源手语词素到文本的翻译性能?
  • RQ2在极端低资源手语设置下,基于规则的增强方法与回译方法相比表现如何?
  • RQ3与通用重排启发式方法相比,语言特定的句法规则在多大程度上能提升翻译质量?
  • RQ4在合成数据上进行预训练是否能实现对真实并行测试集的零样本泛化?
  • RQ5手语与口语之间的句法差异是否可被用于手语翻译中的数据增强?

主要发现

  • Specific- pre 在PHOENIX数据集上达到7.26 BLEU,显著优于General- pre(3.95 BLEU),表明语言特定的句法规则更有效。
  • General- tuned 在PHOENIX数据集上达到23.35 BLEU,相比基线模型提升2.20 BLEU,证明通用规则增强方法具有显著优势。
  • Specific- tuned 在PHOENIX数据集上达到23.17 BLEU,同样显著优于基线模型,证实定制化句法启发式方法的有效性。
  • 仅在合成数据上训练的模型(Specific- pre)在PHOENIX数据集上达到7.26 BLEU,表明仅靠合成数据预训练即可获得非平凡的性能。
  • 与基于规则的方法相比,回译(BT- tuned)表现较差,表明在并行数据过于稀缺时,回译方法无效。
  • 当真实并行数据有限时,数据增强带来的性能提升最为显著,ASL到英语翻译的BLEU分数最高提升达3.14。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。