[论文解读] Progressive Transformers for End-to-End Sign Language Production
本文提出Progressive Transformers,这是首个用于连续手语生成的端到端模型,可直接将口语翻译为3D手语姿态序列。该模型引入了一种计数解码机制,以生成可变长度的连续序列,而无需显式使用结束序列标记(EOS),在PHOENIX14-T数据集上实现了SOTA性能,BLEU-4得分为9.94,优于使用词素(gloss)作为中间表示的模型。
The goal of automatic Sign Language Production (SLP) is to translate spoken language to a continuous stream of sign language video at a level comparable to a human translator. If this was achievable, then it would revolutionise Deaf hearing communications. Previous work on predominantly isolated SLP has shown the need for architectures that are better suited to the continuous domain of full sign sequences. In this paper, we propose Progressive Transformers, a novel architecture that can translate from discrete spoken language sentences to continuous 3D skeleton pose outputs representing sign language. We present two model configurations, an end-to-end network that produces sign direct from text and a stacked network that utilises a gloss intermediary. Our transformer network architecture introduces a counter that enables continuous sequence generation at training and inference. We also provide several data augmentation processes to overcome the problem of drift and improve the performance of SLP models. We propose a back translation evaluation mechanism for SLP, presenting benchmark quantitative results on the challenging RWTH-PHOENIX-Weather-2014T(PHOENIX14T) dataset and setting baselines for future research.
研究动机与目标
- 开发一种端到端模型,从口语文本生成连续手语视频,克服孤立手语合成方法的局限性。
- 解决在不依赖固定词汇表或显式结束序列标记的情况下,生成可变长度连续3D姿态序列的挑战。
- 通过新颖的数据增强技术提升模型稳定性并减少姿态生成过程中的漂移。
- 建立基于回译(back translation)的基准评估协议,用于手语生成任务。
- 证明直接从文本到姿态的翻译可优于依赖词素中间表示的方法,从而降低对昂贵词素标注的依赖。
提出的方法
- 提出一种计数解码机制,用于追踪序列生成进度,实现无需预定义词汇表或EOS标记的连续可变长度输出。
- 采用渐进式Transformer架构,结合多头注意力机制,以建模输入文本与输出姿态序列中的长距离依赖关系。
- 应用随机裁剪、时间缩放和噪声注入等数据增强技术,以减少模型漂移并提升泛化能力。
- 采用回译评估协议:使用训练好的手语翻译(SLT)模型将生成的姿态序列重新翻译回文本,从而实现自动指标计算。
- 实现两种模型配置:T2P(文本到姿态)与T2G2P(文本到词素到姿态),以消融分析词素中间表示的影响。
- 利用RWTH-PHOENIX-Weather-2014 T数据集中的3D姿态序列进行训练与评估,输出表示为联合坐标。
实验结果
研究问题
- RQ1基于Transformer的架构能否在不依赖固定词汇表或EOS标记的情况下,从口语文本生成连续的3D手语姿态序列?
- RQ2在手语生成任务中,直接端到端的文本到姿态翻译是否优于使用词素作为中间表示的模型?
- RQ3数据增强技术在多大程度上能减少漂移并提升生成手语姿态序列的质量?
- RQ4回译评估机制能否为手语生成任务提供可靠且可复现的基准结果?
- RQ5不同模型配置(T2P与T2G2P)对生成手语序列的逼真度与准确性有何影响?
主要发现
- T2P模型(直接进行文本到姿态翻译)在PHOENIX14-T数据集上取得9.94的BLEU-4得分,优于使用词素作为中间表示的T2G2P模型。
- 所提出的计数解码机制实现了无需显式EOS标记的稳定、连续序列生成,提升了推理可靠性。
- 数据增强显著减少了模型漂移,使生成的姿态序列在生成过程中更加准确与稳定。
- 回译评估协议提供了可靠且自动化的手语生成基准,无需人工评估即可实现跨模型比较。
- 定性结果表明,模型生成的序列平滑自然,身体动作准确,手势形状具有语义意义,但专有名词仍具挑战。
- 实验表明,无需词素标注即可实现高质量的手语生成,拓展了手语生成在低资源手语领域的应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。