[论文解读] StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation
StyleTalker 是一种单参考图像、音频驱动的说话头视频生成模型,通过利用预训练的 StyleGAN 和图像编码器,从单张参考图像和音频中合成高保真、口型同步的视频,具备逼真的头部姿态和眨眼效果。它通过条件序列变分自编码器(VAE)结合归一化流进行音频到运动的建模,以及对比性口型同步判别器,实现了最先进的性能,优于以往在音频驱动和运动可控生成设置下的方法。
We propose StyleTalker, a novel audio-driven talking head generation model that can synthesize a video of a talking person from a single reference image with accurately audio-synced lip shapes, realistic head poses, and eye blinks. Specifically, by leveraging a pretrained image generator and an image encoder, we estimate the latent codes of the talking head video that faithfully reflects the given audio. This is made possible with several newly devised components: 1) A contrastive lip-sync discriminator for accurate lip synchronization, 2) A conditional sequential variational autoencoder that learns the latent motion space disentangled from the lip movements, such that we can independently manipulate the motions and lip movements while preserving the identity. 3) An auto-regressive prior augmented with normalizing flow to learn a complex audio-to-motion multi-modal latent space. Equipped with these components, StyleTalker can generate talking head videos not only in a motion-controllable way when another motion source video is given but also in a completely audio-driven manner by inferring realistic motions from the input audio. Through extensive experiments and user studies, we show that our model is able to synthesize talking head videos with impressive perceptual quality which are accurately lip-synced with the input audios, largely outperforming state-of-the-art baselines.
研究动机与目标
- 解决先前单参考图像音频驱动说话头模型在生成逼真头部姿态和眨眼方面存在的局限性。
- 在无需 3D 人脸几何结构或关键点信息的情况下,同时实现音频驱动和运动可控的说话头视频生成。
- 在潜在空间中解耦唇部动作与头部运动及眨眼,实现独立且逼真的控制。
- 通过新型对比判别器和归一化流先验,提升口型同步精度和感知视频质量。
- 证明预训练的图像生成器可通过极少监督有效微调用于音频驱动视频合成。
提出的方法
- 利用预训练的 StyleGAN 和图像编码器,将单张参考图像嵌入潜在空间,保留身份特征的同时支持音频驱动的操控。
- 引入一种对比性口型同步判别器(SyncNet),通过新型对比学习目标训练,以强化精确的音视频对齐。
- 采用条件序列变分自编码器(VAE)建模解耦于唇部动作的运动潜在空间,实现对头部姿态和面部表情的独立控制。
- 通过归一化流增强 VAE 先验,以建模复杂且多模态的音频到运动分布,提升运动的真实感与多样性。
- 利用学习到的音频到运动映射,通过仅音频(音频驱动)或结合运动源视频(运动可控)生成视频。
- 通过基于预测音频驱动运动和口型形状调整参考图像的风格码来重建视频帧,确保帧间身份一致性。
实验结果
研究问题
- RQ1单参考图像说话头模型是否能在无显式 3D 监督或运动源视频的情况下,生成逼真的头部姿态和眨眼?
- RQ2与标准 GAN 损失相比,对比判别器在音频驱动视频生成中能否更有效地提升口型同步精度?
- RQ3归一化流增强的先验在多大程度上能建模复杂、多模态的音频到运动分布,以实现逼真的运动生成?
- RQ4在潜在空间中解耦运动与唇部动作,是否能提升生成说话头视频的可控性与真实感?
- RQ5在感知质量、口型同步精度和运动自然度方面,所提方法与最先进基线相比表现如何?
主要发现
- 在音频驱动生成中,StyleTalker 的口型同步平均意见评分(MOS)达到 4.06 ± 0.22,显著优于 Wav2Lip(3.50 ± 0.32)及其他基线模型。
- 在运动可控生成中,StyleTalker 的口型同步 MOS 为 3.77 ± 0.26,运动自然度 MOS 为 3.65 ± 0.31,优于 PC-AVS(分别为 3.70 ± 0.30 和 2.93 ± 0.31)。
- 消融实验表明,若移除归一化流,运动自然度和视频真实感得分分别降至 13.89% 和 13.89%,表明其在运动质量中的关键作用。
- 若不使用 SyncNet 判别器,LSE-C 分数从 8.51 降至 6.71,证实其在实现精确口型同步中的重要性。
- 用户研究表明,StyleTalker 生成的视频比基线模型更逼真自然,尤其在眨眼和运动多样性方面表现更优,而这些特征在以往方法中常被忽略。
- 该模型成功实现了唇部动作与头部姿态及眨眼的解耦,支持独立控制,从而生成更具表现力和真实感的面部动画。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。