Skip to main content
QUICK REVIEW

[论文解读] Wav2Pix: Speech-conditioned Face Generation using Generative Adversarial Networks

Amanda Duarte, Francisco Roldan|Dublin City University Open Access Institutional Repository (Dublin City University)|Mar 25, 2019
Generative Adversarial Networks and Image Synthesis参考文献 27被引用 9
一句话总结

Wav2Pix 提出了一种条件 GAN,可直接从原始语音波形生成高保真度的人脸图像,而无需任何身份监督,采用在精心筛选的表达性 YouTube 博主视频数据集上训练的自监督方法。该模型实现了 90.25% 的面部关键点检测准确率,表明其具备逼真的面部合成能力,同时在 50.08% 的情况下保留了说话人身份。

ABSTRACT

Speech is a rich biometric signal that contains information about the identity, gender and emotional state of the speaker. In this work, we explore its potential to generate face images of a speaker by conditioning a Generative Adversarial Network (GAN) with raw speech input. We propose a deep neural network that is trained from scratch in an end-to-end fashion, generating a face directly from the raw speech waveform without any additional identity information (e.g reference image or one-hot encoding). Our model is trained in a self-supervised approach by exploiting the audio and visual signals naturally aligned in videos. With the purpose of training from video data, we present a novel dataset collected for this work, with high-quality videos of youtubers with notable expressiveness in both the speech and visual signals.

研究动机与目标

  • 仅基于原始语音生成逼真的人脸图像,无需参考图像或身份标签。
  • 通过利用视频数据中自然的音视频对齐关系,探索跨模态生成。
  • 开发一种自监督训练框架,避免依赖弱对齐或低质量的数据集。
  • 构建一个高质量、经筛选的表达性 YouTube 博主视频数据集,用于语音条件的人脸生成。
  • 评估模型在保留说话人身份和生成多样化、逼真面部外观方面的能力。

提出的方法

  • 使用条件最小二乘 GAN(LSGAN),生成器和判别器均基于原始语音波形进行条件控制。
  • 语音编码器从原始音频中提取 128 维嵌入,该嵌入经投影后用于条件控制生成器和判别器。
  • 生成器从噪声向量和语音嵌入合成人脸图像,而判别器则区分真实人脸与生成的人脸。
  • 使用从新构建的高质量 YouTube 博主视频数据集中提取的对齐音视频片段进行自监督训练。
  • 模型从零开始端到端训练,无需手工设计特征或身份监督。
  • 采用多阶段 U-Net 类架构,结合残差块和转置卷积进行图像生成。

实验结果

研究问题

  • RQ1GAN 是否能够直接从原始语音波形生成逼真的人脸图像,而无需任何身份监督或参考图像?
  • RQ2语音条件的 GAN 在生成的人脸中,对说话人身份的保留程度如何?
  • RQ3语音片段时长和图像分辨率对生成人脸的质量与可检测性有何影响?
  • RQ4在训练过程中,当输入为噪声或低质量音频时,模型性能如何退化?
  • RQ5利用自然视频对齐关系的自监督方法,是否能优于需要显式身份标注的方法?

主要发现

  • 在生成图像上,模型实现了 90.25% 的面部关键点检测准确率,表明其对人脸结构和真实感的强保留能力。
  • 在 50.08% 的测试案例中,说话人身份得以保留,表明实现了中等但有意义的身份迁移。
  • 使用 1000ms 语音片段时,面部检测准确率达到最高(90.25%),而 300ms 和 700ms 片段分别下降至 81.16% 和 89.12%。
  • 图像分辨率降低时,质量显著下降,64×64 生成图像比 128×128 输出更模糊。
  • 当输入为噪声或低质量音频(如背景噪声或多说话人片段)时,模型无法生成可识别的人脸。
  • 短时语音片段和低分辨率图像均导致性能下降,表明模型对输入质量和空间维度敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。