Skip to main content
QUICK REVIEW

[论文解读] Sign Language Transformers: Joint End-to-end Sign Language Recognition and Translation

Necati Cihan Camgöz, Oscar Koller|arXiv (Cornell University)|Mar 30, 2020
Hand Gesture Recognition Systems被引用 4
一句话总结

本文提出 Sign Language Transformers,一种联合端到端架构,通过基于 Transformer 的模型并结合 Connectionist Temporal Classification(CTC)损失实现对词素级别监督的连续手语识别(CSLR)与手语翻译(SLT)同步进行。该方法在 PHOENIX14 T 数据集上取得最先进性能,部分情况下 BLEU-4 分数超过两倍于先前模型(21.80 vs. 9.58),并直接从视频表示翻译,超越了文本到文本翻译基线模型。

ABSTRACT

Prior work on Sign Language Translation has shown that having a mid-level sign gloss representation (effectively recognizing the individual signs) improves the translation performance drastically. In fact, the current state-of-the-art in translation requires gloss level tokenization in order to work. We introduce a novel transformer based architecture that jointly learns Continuous Sign Language Recognition and Translation while being trainable in an end-to-end manner. This is achieved by using a Connectionist Temporal Classification (CTC) loss to bind the recognition and translation problems into a single unified architecture. This joint approach does not require any ground-truth timing information, simultaneously solving two co-dependant sequence-to-sequence learning problems and leads to significant performance gains. We evaluate the recognition and translation performances of our approaches on the challenging RWTH-PHOENIX-Weather-2014T (PHOENIX14T) dataset. We report state-of-the-art sign language recognition and translation results achieved by our Sign Language Transformers. Our translation networks outperform both sign video to spoken language and gloss to spoken language translation models, in some cases more than doubling the performance (9.58 vs. 21.80 BLEU-4 Score). We also share new baseline translation results using transformer networks for several other text-to-text sign language translation tasks.

研究动机与目标

  • 解决手语识别与翻译联合端到端学习的挑战,无需依赖中间词素注释作为瓶颈。
  • 通过在统一的 Transformer 架构中引入 CTC 损失实现识别监督,提升翻译性能。
  • 消除显式词素分词或独立识别阶段的需求,实现从视频到语音的直接翻译。
  • 证明联合训练可同时提升识别与翻译性能。
  • 在多个数据集上建立基于 Transformer 模型的手语翻译新 SOTA 基线。

提出的方法

  • 采用基于 Transformer 的编码器-解码器架构,处理手语视频序列并生成口语语言翻译结果。
  • 在编码器中应用 Connectionist Temporal Classification(CTC)损失,以提供词素级别监督,而无需真实的时间标注。
  • 在单一端到端训练过程中联合优化手语识别与翻译任务。
  • 空间特征通过 3D CNN 主干网络提取,时间建模由 Transformer 编码器与解码器完成。
  • 使用在手语数据上预训练的特定手语特征(如手语数据上的预训练),以提升表示学习效果,优于通用 ImageNet 基础特征。
  • 解码器通过自回归生成方式,逐个 token 条件于编码后的手语特征,生成口语语言输出。

实验结果

研究问题

  • RQ1统一的 Transformer 架构能否在无需中间词素注释的情况下,以端到端方式联合学习手语识别与翻译?
  • RQ2在 Transformer 编码器中引入 CTC 损失是否能同时提升识别与翻译性能?
  • RQ3直接从视频到语音的翻译能否超越依赖中间词素表示的现有文本到语音翻译基线?
  • RQ4在提升手语表示学习方面,预训练的手语特定特征与通用 ImageNet 特征相比表现如何?
  • RQ5识别与翻译的联合学习在多大程度上提升了两个任务的性能?

主要发现

  • 所提出的 Sign Language Transformers 在 PHOENIX14 T 数据集上实现最先进性能,BLEU-4 得分为 21.80,显著优于先前方法(例如,先前工作为 9.58 BLEU-4)。
  • 该模型超越了此前被视为虚拟上限的文本到文本翻译基线,直接从手语视频翻译为口语语言。
  • 识别与翻译的联合训练在两个任务上均带来性能提升,证明了两个问题之间的相互依赖性。
  • 在手语特定数据上预训练的特征优于通用 ImageNet 基础特征,提升了识别与翻译的准确性。
  • 该模型在复杂语言结构上泛化良好,尽管在命名实体与数值表达方面存在挑战,仍能生成语法正确且语义准确的翻译。
  • 消融研究证实,CTC 监督显著提升了识别质量,从而进一步增强了翻译性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。