Skip to main content
QUICK REVIEW

[论文解读] High-resolution Face Swapping via Latent Semantics Disentanglement

Yangyang Xu, Bailin Deng|arXiv (Cornell University)|Mar 30, 2022
Face recognition and analysis被引用 6
一句话总结

本文提出了一种高分辨率人脸替换方法,通过将StyleGAN潜在空间中的语义解耦,分离结构属性(姿态、表情)与外观属性(光照、肤色),采用关键点引导的潜在方向迁移与多尺度特征融合。该方法在图像和视频人脸替换任务中实现了最先进性能,显著提升了幻觉生成质量与时间一致性,优于以往基于GAN的方法在保真度与细节保留方面的表现。

ABSTRACT

We present a novel high-resolution face swapping method using the inherent prior knowledge of a pre-trained GAN model. Although previous research can leverage generative priors to produce high-resolution results, their quality can suffer from the entangled semantics of the latent space. We explicitly disentangle the latent semantics by utilizing the progressive nature of the generator, deriving structure attributes from the shallow layers and appearance attributes from the deeper ones. Identity and pose information within the structure attributes are further separated by introducing a landmark-driven structure transfer latent direction. The disentangled latent code produces rich generative features that incorporate feature blending to produce a plausible swapping result. We further extend our method to video face swapping by enforcing two spatio-temporal constraints on the latent space and the image space. Extensive experiments demonstrate that the proposed method outperforms state-of-the-art image/video face swapping methods in terms of hallucination quality and consistency. Code can be found at: https://github.com/cnnlstm/FSLSD_HiRes.

研究动机与目标

  • 为解决StyleGAN潜在空间中语义纠缠导致的人脸替换质量下降问题,尤其是在高分辨率下的表现问题。
  • 实现身份、结构(姿态/表情)与外观(光照/肤色)的精确解耦,以实现更自然的人脸替换。
  • 通过利用StyleGAN的渐进式、从粗到精的生成特性,提升对特征的控制能力,从而改善高分辨率人脸替换效果。
  • 将方法扩展至视频人脸替换,保持时空一致性,避免帧间不一致现象。

提出的方法

  • 利用StyleGAN的渐进式生成特性,将浅层的结构属性(姿态、表情)与深层的外观属性(光照、肤色)进行解耦。
  • 提出一种基于源域与目标域面部关键点嵌入的地标驱动结构迁移潜在方向,以引导结构迁移。
  • 在深层将目标域的外观代码与已迁移结构的源域潜在代码重新组合,以在保留源域身份的同时采用目标域的结构与外观。
  • 采用多尺度特征聚合机制,融合StyleGAN生成器的生成特征与编码后的目标特征,以消除融合伪影。
  • 为视频人脸替换引入两种时空约束:浅层潜在偏移的代码轨迹约束与RGB空间中的光流轨迹约束。
  • 使用目标编码器-解码器结构以容忍源域与目标域之间的结构不匹配,实现对背景与面部区域的鲁棒融合。

实验结果

研究问题

  • RQ1在StyleGAN中解耦潜在语义是否能通过分离身份、结构与外观属性来提升高分辨率人脸替换的质量?
  • RQ2基于关键点的潜在方向迁移如何在保留源域身份的同时实现精确的结构迁移?
  • RQ3在人脸替换过程中,哪些时空约束能有效维持视频帧间的连续性?
  • RQ4多尺度特征融合在多大程度上可减少高分辨率人脸替换中的融合伪影?
  • RQ5所提出的方法是否能在图像与视频人脸替换基准测试中均达到最先进性能?

主要发现

  • 所提方法在高分辨率人脸替换任务中达到最先进性能,与基线方法(如MegaFS)相比,显著减少了幻觉与模糊现象。
  • 定性结果表明,若省略外观迁移或背景融合模块,消融变体将表现出不自然的风格或明显的融合边界,验证了所提组件的必要性。
  • 通过在多个数据集上的定性对比验证,该方法能有效保留源域身份,同时准确迁移目标域的面部结构与外观。
  • 两种时空约束——代码轨迹约束与光流轨迹约束——显著提升了视频人脸替换中的帧间一致性,消除了逐帧基线方法中常见的不一致现象。
  • 大量实验证明,该方法在视觉质量与细节保留方面表现卓越,尤其在精细面部纹理与背景融合方面优于现有基于GAN的人脸替换方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。