[论文解读] Multimodal-driven Talking Face Generation via a Unified Diffusion-based Generator
本文提出了一种统一的、基于扩散模型的多模态驱动说话人脸生成器,将该任务视为面向目标的纹理迁移,利用CLIP嵌入的文本实现情感控制,并采用纹理-几何感知扩散模型(TGDM)以保持身份和几何结构。该方法在说话人脸生成与人脸换脸任务中均实现了最先进性能,训练与推理过程稳定且无需对抗生成网络(GAN)。
Multimodal-driven talking face generation refers to animating a portrait with the given pose, expression, and gaze transferred from the driving image and video, or estimated from the text and audio. However, existing methods ignore the potential of text modal, and their generators mainly follow the source-oriented feature rearrange paradigm coupled with unstable GAN frameworks. In this work, we first represent the emotion in the text prompt, which could inherit rich semantics from the CLIP, allowing flexible and generalized emotion control. We further reorganize these tasks as the target-oriented texture transfer and adopt the Diffusion Models. More specifically, given a textured face as the source and the rendered face projected from the desired 3DMM coefficients as the target, our proposed Texture-Geometry-aware Diffusion Model decomposes the complex transfer problem into multi-conditional denoising process, where a Texture Attention-based module accurately models the correspondences between appearance and geometry cues contained in source and target conditions, and incorporate extra implicit information for high-fidelity talking face generation. Additionally, TGDM can be gracefully tailored for face swapping. We derive a novel paradigm free of unstable seesaw-style optimization, resulting in simple, stable, and effective training and inference schemes. Extensive experiments demonstrate the superiority of our method.
研究动机与目标
- 解决基于GAN的生成器在多模态说话人脸生成中存在不稳定与泛化能力差的问题。
- 通过将任务重新定义为面向目标的纹理迁移,克服基于源图像的特征重排方法的局限性。
- 通过利用CLIP嵌入有效整合文本模态,实现灵活的零样本情感控制。
- 在单一稳定基于扩散模型的生成器下统一图像、视频、音频与文本驱动的说话人脸生成。
- 通过基于重建的范式将框架扩展至人脸换脸任务,避免采用类似“跷跷板”式的优化策略。
提出的方法
- 将文本提示表示为CLIP嵌入的情感嵌入,以继承丰富的语义信息,实现零样本情感控制。
- 将说话人脸生成建模为面向目标的纹理迁移:将源人脸纹理迁移至由3DMM系数生成的目标人脸。
- 设计一种纹理-几何感知扩散模型(TGDM),通过多条件去噪同时依赖源纹理与目标几何进行条件控制。
- 引入纹理注意力模块,建模源外观与目标几何之间的交叉注意力,实现精确的纹理迁移。
- 利用3DMM系数生成3D渲染的目标人脸作为条件枢纽,确保结构保真度。
- 通过遮罩源身份区域并以渲染后的目标人脸作为条件,将相同的TGDM框架适配于人脸换脸任务,实现稳定基于重建的训练。
实验结果
研究问题
- RQ1是否能有效利用文本模态在无需微调的情况下控制说话人脸生成中的情感?
- RQ2统一的基于扩散模型的生成器是否能够替代多任务专用的基于GAN的架构用于多模态说话人脸生成?
- RQ3面向目标的纹理迁移范式是否在保持身份一致性和减少伪影方面优于基于源的特征重排方法?
- RQ4所提出的TGDM框架是否可扩展至人脸换脸任务,并实现稳定、无需GAN的训练与推理?
- RQ5使用CLIP嵌入的文本如何提升面部动画中的零样本情感泛化能力?
主要发现
- 所提方法在说话人脸生成与人脸换脸任务中均达到最先进性能,在FaceForensics++数据集上取得15.87的FID分数,优于先前方法。
- 方法在身份保持方面达到0.6121的ID-A(身份准确率)与0.1122的夹角误差,显著优于竞争方法。
- 消融实验表明,使用小遮罩(仅排除嘴部区域)的效果优于完整遮罩或扩张遮罩,能更有效地减少伪影。
- 若移除作为条件的3D渲染人脸,则生成结果会向源人脸产生颜色偏移,证明其在属性保持中的关键作用。
- TGDM框架通过简单的重建损失实现稳定训练,避免了基于GAN的人脸换脸中常见的不稳定‘跷跷板’式优化。
- 通过CLIP引导的文本提示,方法能良好泛化至未见情感,实现无需微调的零样本情感控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。