Skip to main content
QUICK REVIEW

[论文解读] Lip Movements Generation at a Glance

Lele Chen, Zhiheng Li|arXiv (Cornell University)|Mar 28, 2018
Speech and Audio Processing参考文献 26被引用 3
一句话总结

本文提出了一种新颖的端到端深度学习框架,仅使用单张目标身份图像和任意语音音频,即可生成逼真且身份一致的唇部动作。通过融合音频与图像嵌入,并引入一种新颖的音视频相关性损失,该模型能够生成具有高度时间一致性的16帧唇部动作序列,在GRID、LDC和LRW数据集上的定量与定性评估中,均优于当前最先进方法。

ABSTRACT

Cross-modality generation is an emerging topic that aims to synthesize data in one modality based on information in a different modality. In this paper, we consider a task of such: given an arbitrary audio speech and one lip image of arbitrary target identity, generate synthesized lip movements of the target identity saying the speech. To perform well in this task, it inevitably requires a model to not only consider the retention of target identity, photo-realistic of synthesized images, consistency and smoothness of lip images in a sequence, but more importantly, learn the correlations between audio speech and lip movements. To solve the collective problems, we explore the best modeling of the audio-visual correlations in building and training a lip-movement generator network. Specifically, we devise a method to fuse audio and image embeddings to generate multiple lip images at once and propose a novel correlation loss to synchronize lip changes and speech changes. Our final model utilizes a combination of four losses for a comprehensive consideration in generating lip movements; it is trained in an end-to-end fashion and is robust to lip shapes, view angles and different facial characteristics. Thoughtful experiments on three datasets ranging from lab-recorded to lips in-the-wild show that our model significantly outperforms other state-of-the-art methods extended to this task.

研究动机与目标

  • 仅使用一张参考图像和任意语音音频,为目标身份生成高保真度的唇部动作,且在训练过程中无需目标身份的视频帧。
  • 建模不同身份之间语音与唇部动作之间的复杂时间相关性。
  • 确保生成的唇部动作序列具有时间一致性、照片级真实感,并保留身份特异性特征(如胡须或嘴唇形状)。
  • 开发对视角变化、面部特征和唇部几何结构变化具有鲁棒性的训练框架。
  • 在包括野外场景在内的多样化数据集上,于定量指标与定性真实感方面均超越现有方法。

提出的方法

  • 该模型使用生成器网络,将时序音频嵌入与单张图像身份嵌入融合,一次性前向传播生成16帧连续的唇部动作。
  • 引入一种新颖的音视频相关性损失,以实现唇部动作变化与语音信号变化的时间对齐,提升时间同步性。
  • 训练采用四损失目标:重建损失(像素级)、特征空间损失(感知相似性)、三流生成对抗损失(图像与运动质量)以及所提出的音视频相关性损失。
  • 判别器设计为三流结构,联合评估图像质量、运动平滑性与音视频对齐程度。
  • 整个模型以端到端方式训练,实现身份保留、视觉质量与音视频同步性的联合优化。
  • 由于解耦嵌入与多损失训练,该方法对人脸特征(如胡须)、唇形与视角变化具有鲁棒性。

实验结果

研究问题

  • RQ1基于单张参考图像的唇部动作生成模型是否能在不依赖目标身份训练视频帧的情况下,实现高身份保真度与时间一致性?
  • RQ2在端到端训练过程中,如何有效建模并强制实现音视频相关性,以提升唇部与语音的同步性?
  • RQ3在有限数据上训练的模型在未见身份与野外场景下的泛化能力如何?
  • RQ4何种损失组合能最佳平衡唇部动作生成中的照片真实感、运动平滑性与音视频对齐?
  • RQ5在低分辨率输入或未见面部特征等挑战性条件下,模型表现如何?

主要发现

  • 所提模型在GRID、LDC和LRW三个数据集上,于LMD、PSNR、SSIM和CPBD等多项指标上显著优于当前最先进方法。
  • 在关键点距离(LMD)与PSNR指标上表现最佳,表明其相比仅使用重建损失或标准GAN的方法,具有更优的对齐精度与像素级准确性。
  • CPBD指标显示,该模型在LRW数据集上生成的图像比真实图像更清晰,可能归因于模型对低分辨率输入的增强能力。
  • 定性结果表明,即使目标身份在训练中未出现,模型仍能稳健保留身份特征,如胡须与面部不对称性。
  • 在更大规模的LRW数据集上训练的模型泛化能力优于在GRID数据集上训练的模型,尤其在保留未见个体的身份信息方面表现更优。
  • 尽管性能优异,该模型偶尔在肤色保留上表现不佳,可能由于LRW数据集中存在类别不平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。