Skip to main content
QUICK REVIEW

[论文解读] FLNet: Landmark Driven Fetching and Learning Network for Faithful Talking Facial Animation Synthesis

Kuangxiao Gu, Yuqian Zhou|arXiv (Cornell University)|Nov 21, 2019
Generative Adversarial Networks and Image Synthesis参考文献 27被引用 8
一句话总结

FLNet 提出了一种基于关键点的双流网络,通过基于变形的特征获取流和基于外观的特征学习流,融合五张源图像的面部细节,实现高保真的说话人脸动画合成。该方法在定量和定性结果上均表现优异,尤其在保留牙齿、眼睛等细微面部特征方面优于单图像基线方法。

ABSTRACT

Talking face synthesis has been widely studied in either appearance-based or warping-based methods. Previous works mostly utilize single face image as a source, and generate novel facial animations by merging other person's facial features. However, some facial regions like eyes or teeth, which may be hidden in the source image, can not be synthesized faithfully and stably. In this paper, We present a landmark driven two-stream network to generate faithful talking facial animation, in which more facial details are created, preserved and transferred from multiple source images instead of a single one. Specifically, we propose a network consisting of a learning and fetching stream. The fetching sub-net directly learns to attentively warp and merge facial regions from five source images of distinctive landmarks, while the learning pipeline renders facial organs from the training face space to compensate. Compared to baseline algorithms, extensive experiments demonstrate that the proposed method achieves a higher performance both quantitatively and qualitatively. Codes are at https://github.com/kgu3/FLNet_AAAI2020.

研究动机与目标

  • 为解决单图像方法在忠实合成隐藏或复杂面部细节(如牙齿和眼睛)方面的局限性。
  • 通过利用具有不同面部关键点的多张源图像,提升面部动画的保真度。
  • 结合基于变形的特征获取与基于外观的特征学习,实现鲁棒且身份一致的面部动画生成。
  • 通过端到端生成高质量、逼真的面部动画,避免后处理步骤。

提出的方法

  • 网络采用双流架构:基于变形的特征获取流与基于外观的特征学习流。
  • 特征获取流利用注意力机制,根据关键点对齐,从五张源图像中选择、变形并融合面部区域。
  • 特征学习流从训练人脸空间中学习面部外观特征,以弥补未见或缺失的细节。
  • 两路输出经过融合生成最终面部图像,确保身份一致性和细节保真度。
  • 多图像源图像库使模型能够访问多样化的面部几何结构,提升对遮挡或复杂区域的建模能力。
  • 模型通过对抗损失与感知损失进行端到端训练,以增强真实感与结构准确性。

实验结果

研究问题

  • RQ1使用具有不同关键点的多张源图像,是否能提升牙齿、眼睛等细微面部细节的合成效果?
  • RQ2基于变形的特征获取与基于外观的特征学习相结合,如何提升面部动画的保真度?
  • RQ3源图像库的大小对生成面部动画质量有何影响?
  • RQ4所提方法是否在保持身份与细节方面优于单图像基线方法?
  • RQ5基于注意力的区域选择机制在处理遮挡或未见面部几何结构时是否有效?

主要发现

  • 采用五张源图像的完整 FLNet 模型取得最高 FID 分数(12.8)与 LPIPS 值(0.15),显著优于单图像基线方法。
  • 消融实验表明,仅使用基于外观的流会导致牙齿与皱纹等细节模糊,而仅使用基于变形的流在隐藏区域表现失败。
  • 使用三张源图像的模型优于单图像输入,但仍逊色于五图像源库版本。
  • 可视化结果证实,注意力掩码能动态选择不同源图像中的最优区域,例如从一张图像获取闭眼,从另一张获取张开的嘴巴。
  • 在齿音辅音(Interdental Consonants)场景下出现失败案例,归因于关键点配置模糊,表明需引入音频辅助优化。
  • 该方法无需后处理即可生成高保真动画,表明在定性与定量评估中均具备鲁棒性与真实感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。