Skip to main content
QUICK REVIEW

[论文解读] Signing at Scale: Learning to Co-Articulate Signs for Large-Scale Photo-Realistic Sign Language Production

Ben Saunders, Necati Cihan Camgöz|arXiv (Cornell University)|Mar 29, 2022
Hand Gesture Recognition Systems被引用 6
一句话总结

本文提出了一种可扩展的、逼真的手语生成系统,通过帧选择网络(FS-Net)学习词典手语之间的共发音特征,并利用一种新型关键点损失的姿势条件生成对抗网络(SignGAN)生成高保真手语视频。该方法在 PHOENIX14 T 数据集上的回译任务中达到最先进性能,并在真实感与可理解性方面显著优于基线方法,获得聋人用户的广泛青睐。

ABSTRACT

Sign languages are visual languages, with vocabularies as rich as their spoken language counterparts. However, current deep-learning based Sign Language Production (SLP) models produce under-articulated skeleton pose sequences from constrained vocabularies and this limits applicability. To be understandable and accepted by the deaf, an automatic SLP system must be able to generate co-articulated photo-realistic signing sequences for large domains of discourse. In this work, we tackle large-scale SLP by learning to co-articulate between dictionary signs, a method capable of producing smooth signing while scaling to unconstrained domains of discourse. To learn sign co-articulation, we propose a novel Frame Selection Network (FS-Net) that improves the temporal alignment of interpolated dictionary signs to continuous signing sequences. Additionally, we propose SignGAN, a pose-conditioned human synthesis model that produces photo-realistic sign language videos direct from skeleton pose. We propose a novel keypoint-based loss function which improves the quality of synthesized hand images. We evaluate our SLP model on the large-scale meineDGS (mDGS) corpus, conducting extensive user evaluation showing our FS-Net approach improves co-articulation of interpolated dictionary signs. Additionally, we show that SignGAN significantly outperforms all baseline methods for quantitative metrics, human perceptual studies and native deaf signer comprehension.

研究动机与目标

  • 为非受限语域(unconstrained domains of discourse)的手语视频生成提供共发音、逼真的解决方案。
  • 通过建模词典手语之间的时序语调特征,提升合成手语的自然度与可理解性。
  • 开发一种可扩展的手语生成系统(SLP),使其超越天气预报等有限领域数据集的泛化能力。
  • 提升生成手语视频中手部图像的质量,尤其在运动模糊情况下的表现。
  • 通过与母语聋人手语者的全面用户评估,验证系统的有效性。

提出的方法

  • 提出帧选择网络(FS-Net),利用带有交叉注意力机制的 Transformer 编码器,学习词典手语与连续手语序列之间的最优时间对齐路径,监督信号来自动态时间规整(DTW)。
  • 提出 SignGAN,一种基于姿势条件的视频到视频生成模型,可从骨骼姿态序列生成逼真的手语视频。
  • 设计一种新型基于关键点的损失函数,作用于关键点空间,以提升手部图像质量并减轻合成过程中的运动模糊伪影。
  • 采用多模态、可控的视频生成框架,利用真实手语者数据提取的外观嵌入,建模多样化的手语风格。
  • 采用两阶段流水线:第一阶段为文本到词素翻译;第二阶段通过 FS-Net 实现词素到共发音姿态的映射;最终通过 SignGAN 实现姿态到视频的生成。
  • 利用大规模 mDGS 语料库进行训练与评估,实现对非受限语域的泛化能力。

实验结果

研究问题

  • RQ1深度学习模型能否学习词典手语之间的共发音特征,以生成平滑、连续的手语序列?
  • RQ2基于姿势条件的 GAN 能否生成在感知上与真实数据无法区分的逼真手语视频?
  • RQ3基于关键点的损失函数是否能显著提升手语视频生成中手部图像的质量?
  • RQ4所提出的 SLP 系统能否在天气预报之外的大规模、非受限语域中实现泛化?
  • RQ5与传统基于骨骼的表示相比,生成的逼真内容是否更易于母语聋人手语者理解?

主要发现

  • FS-Net 显著提升了插值词典手语的共发音效果,经聋人用户评估验证,参与者对 FS-Net 输出的偏好远超基线方法。
  • SignGAN 在 PHOENIX14 T 基准上的回译任务中性能相比先前方法提升 43%,表明其具有极高的语义保真度。
  • 在感知评估中,SignGAN 在 96.2% 的案例中被评价为身体真实感更优,在 95.6% 的案例中手部真实感更优,而 Vid2vid 作为最强基线,偏好度为 85.9%。
  • 合成的逼真视频在聋人参与者中的理解度评分为 3.9/5,显著高于基于骨骼序列的表示(3.2/5),证明其可理解性更强。
  • 基于关键点的损失将 FID 从基线的 39.33 降低至 27.75,手部 SSIM 从 0.582 提升至 0.605,证实手部图像合成质量得到改善。
  • SignGAN 在 C4A 数据集上的定量指标(FID、SSIM、手部 SSIM)及人类感知评估中均优于所有最先进方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。