Skip to main content
QUICK REVIEW

[论文解读] Keypoint based Sign Language Translation without Glosses

Youngmin Kim, Minji Kwak|arXiv (Cornell University)|Apr 22, 2022
Hand Gesture Recognition Systems被引用 7
一句话总结

本文提出了一种基于关键点的签名语言翻译(SLT)方法,通过引入针对骨骼关键点向量的定制化归一化技术以及用于动态视频长度适应的随机帧选择策略(SASS),绕过了词汇注释的需求。该方法在高分辨率和低分辨率SLT数据集上均实现了最先进性能,且无需依赖词汇注释,展现出在多样化数据集上的鲁棒性与泛化能力。

ABSTRACT

Sign Language Translation (SLT) is a task that has not been studied relatively much compared to the study of Sign Language Recognition (SLR). However, the SLR is a study that recognizes the unique grammar of sign language, which is different from the spoken language and has a problem that non-disabled people cannot easily interpret. So, we're going to solve the problem of translating directly spoken language in sign language video. To this end, we propose a new keypoint normalization method for performing translation based on the skeleton point of the signer and robustly normalizing these points in sign language translation. It contributed to performance improvement by a customized normalization method depending on the body parts. In addition, we propose a stochastic frame selection method that enables frame augmentation and sampling at the same time. Finally, it is translated into the spoken language through an Attention-based translation model. Our method can be applied to various datasets in a way that can be applied to datasets without glosses. In addition, quantitative experimental evaluation proved the excellence of our method.

研究动机与目标

  • 为解决缺乏直接从签名语言到文本的翻译问题,通过消除对中间词汇注释的依赖来实现。
  • 通过开发一种针对身体部位的归一化方法,提升关键点SLT的性能,增强在不同签名者姿势和摄像头视角下的特征鲁棒性。
  • 通过引入一种随机帧选择方法,解决SLT中视频长度可变的挑战,实现动态采样与增强。
  • 构建一种可广泛适用的视频处理流水线,适用于多个SLT数据集,特别是那些无词汇注释的数据集。
  • 通过在真实世界签名语言数据集上进行全面的消融实验与定性评估,证明所提方法的有效性。

提出的方法

  • 提出一种定制化的关键点归一化方法,根据不同身体部位(如手部、面部、躯干)应用不同的归一化策略,提升在不同签名者姿势与摄像头视角下的特征一致性。
  • 引入随机增强与跳过采样(SASS)方法,通过概率采样优先选择关键帧,同时根据视频时长动态调整输入序列长度。
  • 采用基于GRU的编码器-解码器架构并结合Bahdanau注意力机制,实现序列到序列的签名语言翻译,以归一化后的关键点序列为输入。
  • 通过关键点间距离的帧级归一化,减少空间方差,提升在分辨率与签名者位置各异的数据集上的模型泛化能力。
  • 在归一化与帧选择后采用固定长度的关键点表示,使模型与标准神经机器翻译(NMT)模型兼容。
  • 设计端到端可训练的流水线,适用于无词汇注释的数据集,提升在真实场景中的实际可用性。

实验结果

研究问题

  • RQ1基于关键点的SLT系统是否能在不依赖中间词汇注释的情况下实现高性能?
  • RQ2针对身体部位的归一化方法在签名语言视频处理中如何提升关键点表征的鲁棒性?
  • RQ3随机帧选择策略是否能有效平衡不同长度视频的信息保留与计算效率?
  • RQ4所提方法是否能在无需固定输入长度的前提下,泛化于分辨率与视频长度各异的数据集?
  • RQ5与标准归一化和固定采样相比,定制化归一化与SASS的组合在翻译质量上表现如何?

主要发现

  • 所提出的定制化归一化方法显著优于标准归一化,尤其在处理姿势与视角变化方面表现突出。
  • SASS方法优于固定采样与仅使用随机增强的方法,在所有数据集上均实现了最佳整体翻译性能。
  • 在RWTH-PHOENIX-Weather-2014 T数据集上,模型能准确翻译短至中等长度的句子,但长句在句末略有性能下降。
  • 在KETI数据集上,模型对长句实现了高度准确的翻译,大多数情况下与真实标签近乎完美对齐。
  • 消融实验表明,定制化归一化与SASS在性能提升中均发挥独立且协同的作用,完整方法优于所有基线模型。
  • 该方法在跨数据集泛化方面表现强劲——在高分辨率(KETI)与低分辨率(PHOENIX)基准上均表现优异,且无需针对特定数据集进行调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。