Skip to main content
QUICK REVIEW

[论文解读] V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation

Cong Wang, Kuan Tian|arXiv (Cornell University)|Jun 4, 2024
Augmented Reality Applications被引用 4
一句话总结

V-Express 通过条件丢弃和渐进式训练策略,在人像视频生成中平衡多模态控制信号,实现了有效的音频驱动口型同步,同时保持身份和姿态控制。该方法在扩散模型生成中实现了最先进水平的视频质量和对齐效果,在 AVSpeech 数据集上取得 3.480 的 SyncNet 得分,在 TalkingHead-1KH 数据集上达到 23.38 的 FID,展示了在扩散生成中强大的音频控制能力。

ABSTRACT

In the field of portrait video generation, the use of single images to generate portrait videos has become increasingly prevalent. A common approach involves leveraging generative models to enhance adapters for controlled generation. However, control signals (e.g., text, audio, reference image, pose, depth map, etc.) can vary in strength. Among these, weaker conditions often struggle to be effective due to interference from stronger conditions, posing a challenge in balancing these conditions. In our work on portrait video generation, we identified audio signals as particularly weak, often overshadowed by stronger signals such as facial pose and reference image. However, direct training with weak signals often leads to difficulties in convergence. To address this, we propose V-Express, a simple method that balances different control signals through the progressive training and the conditional dropout operation. Our method gradually enables effective control by weak conditions, thereby achieving generation capabilities that simultaneously take into account the facial pose, reference image, and audio. The experimental results demonstrate that our method can effectively generate portrait videos controlled by audio. Furthermore, a potential solution is provided for the simultaneous and effective use of conditions of varying strengths.

研究动机与目标

  • 为解决控制信号强度失衡问题,特别是当强信号(如姿态、参考图像)主导弱信号(如音频)时在人像视频生成中的影响。
  • 实现对弱控制信号(如音频)的有效且稳定的训练,这些信号常因强信号的干扰而无法有效影响生成结果。
  • 开发一种在单一生成框架中同时且有效地整合不同强度控制信号的方法。
  • 在保持面部身份和姿态一致性的前提下,提升音频驱动的口型同步效果。

提出的方法

  • V-Express 采用潜在扩散模型(LDM),结合 VAE 编码器与解码器,在潜在空间中实现图像到视频的生成。
  • 使用三个控制头:ReferenceNet 用于身份控制,V-Kps Guider 用于面部姿态控制,Audio Projection 用于音频驱动的口型运动。
  • 在训练过程中应用条件丢弃:V-Kps 和参考图像特征分别以 50% 和 20% 的丢弃率随机掩码,以减轻其主导影响。
  • 渐进式训练通过调度丢弃率和信号注入时机,逐步增强弱信号(如音频)的强度。
  • 采用多阶段训练流程:第一阶段在无音频的视频帧上进行训练(使用 VFHQ),第二阶段和第三阶段逐步引入音频并优化控制信号。
  • 分析扩散模型中的交叉注意力权重,验证音频注意力可被调制以影响口部运动,确认信号的可控制性。
Figure 1: The framework of V-Express.
Figure 1: The framework of V-Express.

实验结果

研究问题

  • RQ1当强信号(如姿态、参考图像)占主导地位时,弱控制信号(如音频)能否被有效整合到人像视频生成中?
  • RQ2渐进式训练与条件丢弃如何改善多条件生成中弱信号的收敛性与控制保真度?
  • RQ3在不损害面部身份或姿态准确性的情况下,音频驱动的口型同步能达到何种程度?
  • RQ4所提方法能否在保持高视频质量与时间连贯性的前提下,平衡多种强度不同的控制信号?

主要发现

  • 在 AVSpeech 数据集上,V-Express 取得 3.480 的 SyncNet 得分,优于 Wav2Lip(6.890)和 DiffusedHeads(无得分可用),表明口型同步性能更优。
  • 在 TalkingHead-1KH 数据集上,V-Express 的 FID 为 25.81,FVD 为 135.82,显著优于 Wav2Lip(FID: 29.06,FVD: 250.95)和 DiffusedHeads(FID: 115.41,FVD: 344.69)。
  • 在 TalkingHead-1KH 上,身份偏差降低 3.63(ΔFaceSim),表明与真实样本相比具有更强的面部身份保持能力。
  • KpsDis 降低至 3.28,表明生成结果与目标面部姿态的对齐性显著提升。
  • 视觉结果证实,音频注意力权重可被调节以控制口部运动强度,验证了音频信号的可调制性。
  • 消融实验表明,条件丢弃能有效减少强信号的干扰,使音频信号对生成过程产生有意义的影响。
Figure 2: Some results of V-Express.
Figure 2: Some results of V-Express.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。