Skip to main content
QUICK REVIEW

[论文解读] Everybody Sign Now: Translating Spoken Language to Photo Realistic Sign Language Video

Ben Saunders, Necati Cihan Camgöz|arXiv (Cornell University)|Nov 19, 2020
Hand Gesture Recognition Systems参考文献 65被引用 36
一句话总结

SignGAN 将口语翻译为连续、照片级真实的手语视频,先通过 Transformer+MDN 生成骨架姿态,然后以可控的多签者风格渲染出照片级真实的签手语者,并使用聚焦手部的关键点损失来提升手部质量。

ABSTRACT

To be truly understandable and accepted by Deaf communities, an automatic Sign Language Production (SLP) system must generate a photo-realistic signer. Prior approaches based on graphical avatars have proven unpopular, whereas recent neural SLP works that produce skeleton pose sequences have been shown to be not understandable to Deaf viewers. In this paper, we propose SignGAN, the first SLP model to produce photo-realistic continuous sign language videos directly from spoken language. We employ a transformer architecture with a Mixture Density Network (MDN) formulation to handle the translation from spoken language to skeletal pose. A pose-conditioned human synthesis model is then introduced to generate a photo-realistic sign language video from the skeletal pose sequence. This allows the photo-realistic production of sign videos directly translated from written text. We further propose a novel keypoint-based loss function, which significantly improves the quality of synthesized hand images, operating in the keypoint space to avoid issues caused by motion blur. In addition, we introduce a method for controllable video generation, enabling training on large, diverse sign language datasets and providing the ability to control the signer appearance at inference. Using a dataset of eight different sign language interpreters extracted from broadcast footage, we show that SignGAN significantly outperforms all baseline methods for quantitative metrics and human perceptual studies.

研究动机与目标

  • 提出对面向聋人群体、超越骨架表示的、真正易于理解的照片级真实手语生成(SLP)的需求。
  • 提出一个联合流水线,将口语翻译为连续的手语姿态,然后再转换成高质量的签者视频。
  • 通过新颖的损失函数和可控生成来解决手部图像质量和签者变异性的问题。
  • 通过将内容(姿态)与风格(签者外观)分离,实现对多样数据集的训练。
  • 在回译和感知指标上与基线进行对比评估,以证明改进。

提出的方法

  • 使用基于 Transformer 的连续手语生成模块,并结合混合密度网络(MDN)来建模以口语为条件的多模态姿态分布。
  • 将生成的手语姿态转换为热力图表示,以条件化视频合成网络。
  • 采用基于姿态条件的视频到视频合成模块,使用多尺度 GAN(生成器 G 与判别器 D1–D3),以生成照片级真实的签者视频,采用 U-Net 风格的跳跃连接。
  • 引入手部关键点损失,使用预训练的手部姿态估计器在关键点空间监督手部区域,缓解手部合成中的运动模糊。
  • 通过以签者风格图像为条件实现可控视频生成,支持多签者输出并在推断阶段实现外观控制。
  • 将对抗损失、特征匹配损失、感知损失,以及时序一致性损失结合成视频合成的总目标 L_Total。
  • 分别在用于手语生成(PHOENIX14T)的 SLP 数据集和用于签者视频生成的数据集上进行训练,以利用数据质量差异,并进行姿态归一化以对齐数据集。

实验结果

研究问题

  • RQ1一个端到端的流水线能否在保持签者身份和外观的一致性的前提下,将口语翻译为照片级真实的手语视频?
  • RQ2引入基于 MDN 的多模态姿态模型是否能相较于确定性方法提升连续手语生成?
  • RQ3基于姿态条件、可控的签者生成是否提升感知真实感以及在多个签者之间的一致性?
  • RQ4基于手部关键点的损失是否能在手部区域提高质量并相对于手部的标准判别器减少模糊?
  • RQ5在回译与感知研究中,SignGAN 相对于最先进基线的表现如何?

主要发现

  • SignGAN 在 PHOENIX14T 数据集的文本到姿态翻译任务上实现了最先进的回译 BLEU-4(测试集为 12.18)。
  • SignGAN 在基于姿态条件的签者生成方面,在全指标(SSIM、Hand SSIM、Hand Pose distance、FID)上均超过单一与多签者数据集的基线。
  • 手部关键点损失显著提高手部区域质量和 Hand SSIM,与标准的手部判别器相比。
  • 具备多签者风格的可控生成在 SSIM、FID 上表现更好,并在用户研究中提升感知偏好。
  • 基于 MDN 的多模态姿态建模减少回归中位趋势,并产生比确定性方法更具表现力的手语姿态序列。
  • 主观感知研究表明,在单签者和多签者设置下,SignGAN 在身体和手部方面均优于基线,偏好比例较高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。