[论文解读] Emotion-Controllable Generalized Talking Face Generation
本文提出了一种一次性的、可控制情绪的说话人脸生成方法,通过单张中性身份图像即可泛化至任意未见过的人脸。该方法采用图卷积网络,基于语音和情绪输入生成具有几何感知能力的面部关键点运动,随后通过光流引导的纹理生成网络,分离身份、运动和情绪,实现跨多种身份和情绪的逼真、可控人脸动画。
Despite the significant progress in recent years, very few of the AI-based talking face generation methods attempt to render natural emotions. Moreover, the scope of the methods is majorly limited to the characteristics of the training dataset, hence they fail to generalize to arbitrary unseen faces. In this paper, we propose a one-shot facial geometry-aware emotional talking face generation method that can generalize to arbitrary faces. We propose a graph convolutional neural network that uses speech content feature, along with an independent emotion input to generate emotion and speech-induced motion on facial geometry-aware landmark representation. This representation is further used in our optical flow-guided texture generation network for producing the texture. We propose a two-branch texture generation network, with motion and texture branches designed to consider the motion and texture content independently. Compared to the previous emotion talking face methods, our method can adapt to arbitrary faces captured in-the-wild by fine-tuning with only a single image of the target identity in neutral emotion.
研究动机与目标
- 解决现有音频驱动说话人脸生成方法中缺乏情绪控制和泛化能力的问题。
- 仅使用单张中性身份图像,实现在任意未见过人脸上的情绪可控动画。
- 在纹理生成过程中分离身份、语音驱动的运动以及情绪驱动的形变。
- 通过基于图的关键点表示,提升动画过程中的面部几何结构保持和情绪一致性。
- 在无需身份特定微调或大规模数据集的情况下,实现高保真度和身份保留的面部表情生成。
提出的方法
- 图卷积网络(GCN)将语音内容和情绪输入编码,生成在Delaunay三角剖分面部关键点图上的运动,保持几何结构。
- 关键点运动预测通过可学习的边权重和跳跃连接进行引导,以维持空间依赖性并改善特征传播。
- 光流引导的纹理生成网络利用预测的关键点运动,合成具有情绪特异性形变的身份一致的面部纹理。
- 纹理网络采用双分支架构,以分离运动和纹理内容,并通过情绪特征输入控制面部表情。
- 在推理阶段应用一次学习,通过微调纹理网络并使用目标身份的一张中性人脸图像实现。
- 采用对抗性损失和感知损失,以增强最终视频生成的逼真度和身份保留性。
实验结果
研究问题
- RQ1仅使用一张中性身份图像,说话人脸生成模型能否泛化至任意未见过的人脸?
- RQ2如何有效建模面部几何结构和情绪驱动的形变,以在情绪动画中保持面部结构?
- RQ3能否在运动生成过程中实现语音与情绪的解耦,以实现对面部表情的独立控制?
- RQ4光流引导的纹理生成方法是否能提升情绪可控说话人脸合成中的逼真度和身份保留性?
- RQ5在多样化的身份和数据集上,该方法在情绪准确率、口型同步和视觉真实感方面与最先进方法相比表现如何?
主要发现
- 用户研究表明,该方法在身份保留和情绪分类准确率方面达到最先进水平,平均得分分别为4.3/5和4.5/5。
- 该方法可泛化至未见过的数据集(如RAVDESS和CREMA-D)中的任意人脸,无需微调即可生成逼真的情绪表达。
- 消融实验表明,若移除情绪特征或情绪关键点,情绪准确率显著下降,证实其在表达性动画中的必要性。
- 一次学习提升了身份保留性,表现为更高的CSIM分数,以及在生成视频中更佳的面部结构和肤色保留。
- 光流引导的纹理网络在视觉真实感和一致性方面优于基线方法,尤其在捕捉细微情绪线索(如眉毛运动和嘴部形状变化)方面表现更优。
- 该方法在保持高口型同步准确率的同时,实现了情绪的独立控制,而先前方法常产生不一致或不自然的表情。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。