[论文解读] Attention-Based Lip Audio-Visual Synthesis for Talking Face Generation in the Wild
本文提出 AttnWav2Lip,一种基于注意力机制的音视频合成模型,用于说话人脸生成中的唇形同步,通过将空间注意力模块和通道注意力模块整合到 Wav2Lip 框架中,增强对唇部区域的关注。该方法在 LRW、LRS2 和 LRS3 数据集上达到最先进性能,与基线相比,LSE-D 降低 4.1%,LSE-C 提高 1.9%。
Talking face generation with great practical significance has attracted more attention in recent audio-visual studies. How to achieve accurate lip synchronization is a long-standing challenge to be further investigated. Motivated by xxx, in this paper, an AttnWav2Lip model is proposed by incorporating spatial attention module and channel attention module into lip-syncing strategy. Rather than focusing on the unimportant regions of the face image, the proposed AttnWav2Lip model is able to pay more attention on the lip region reconstruction. To our limited knowledge, this is the first attempt to introduce attention mechanism to the scheme of talking face generation. An extensive experiments have been conducted to evaluate the effectiveness of the proposed model. Compared to the baseline measured by LSE-D and LSE-C metrics, a superior performance has been demonstrated on the benchmark lip synthesis datasets, including LRW, LRS2 and LRS3.
研究动机与目标
- 为解决在非约束性说话人脸生成中,尤其是在真实世界(野外)视频场景下唇形同步不准确的挑战。
- 通过在训练过程中引导模型关注嘴部区域,提升唇部区域的重建质量,减少对无关面部区域的关注。
- 探究将注意力机制(特别是空间注意力与通道注意力)整合到音视频唇形同步模型中的有效性。
- 在无需语言特定微调的情况下,实现在多种数据集上的鲁棒唇形同步性能,支持对未见数据的零样本推理。
- 证明注意力机制可显著提升唇形同步精度,超越标准的 GAN 或自编码器方法。
提出的方法
- 将空间注意力模块(SAM)和通道注意力模块(CAM)集成到 Wav2Lip 生成器网络的卷积块中。
- 采用 CBAM 风格的注意力模块,基于特征图计算注意力图,突出显示重要空间位置和通道特征响应。
- 应用残差连接以保持梯度流动并稳定添加注意力模块后的训练过程。
- 使用预训练的唇形同步判别器进行对抗训练,同步惩罚权重(α = 0.03)经手动调优以提升收敛性。
- 采用 L1 重建损失与音视频同步损失(Lsync)相结合的方式进行模型训练,通过人脸检测(S3FD)和缩放至 96×96×3 实现数据增强。
- 从预训练的 Wav2Lip 检查点进行微调,固定 α = 0.03 以稳定训练,否则标准调度策略会导致训练无法收敛。
实验结果
研究问题
- RQ1将空间与通道注意力机制整合是否能提升非约束性说话人脸生成中的唇形同步精度?
- RQ2将模型注意力引导至唇部区域是否能相比标准卷积网络实现更优的嘴部运动重建?
- RQ3空间注意力与通道注意力模块各自对唇形同步性能的贡献如何?哪一种更有效?
- RQ4所提出的基于注意力的模型是否能在无需微调的情况下,泛化至多个基准数据集(LRW、LRS2、LRS3)?
- RQ5注意力机制是否能在同步指标(LSE-D 与 LSE-C)上超越现有最先进模型(如 Wav2Lip 与 LipGAN)?
主要发现
- 所提出的 AttnWav2Lip 模型在 LRS3 数据集上取得 7.339 的 LSE-D 分数与 6.530 的 LSE-C 分数,优于基线模型 Wav2Lip(7.521 LSE-D,6.406 LSE-C)。
- 消融实验证实,空间注意力与通道注意力均能提升性能,其中空间注意力对同步精度的贡献更为显著。
- 空间注意力图可视化显示,模型明确聚焦于唇部区域,注意力权重在嘴部区域更为集中。
- 与基线 Wav2Lip 相比,该模型在所有测试数据集上均实现 LSE-D 降低 4.1%、LSE-C 提高 1.9%,表现出一致的性能提升。
- 该模型在无需任何微调的情况下,于 LRW、LRS2 与 LRS3 上均实现优异的零样本推理性能,表明其具备强大的泛化能力。
- 手动调优同步惩罚权重(α = 0.03)对训练稳定至关重要,因原始自适应调度策略无法使 Lsync 降低至 0.75 以下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。