[论文解读] Make a Face: Towards Arbitrary High Fidelity Face Manipulation
本文提出了一种新型的条件变分自编码器框架——加法聚焦变分自编码器(AF-VAE),仅使用弱监督即可在256×256分辨率下实现高保真度、任意的面部图像操控。通过在结构潜在空间中引入带有无监督聚类的加法高斯混合先验,以及受人类视觉系统(HVS)启发的网络结构设计,AF-VAE在CelebA数据集上实现了最先进水平的FID(36.82)与Inception Score(2.15),显著提升了面部操控任务中的图像质量和多样性。
Recent studies have shown remarkable success in face manipulation task with the advance of GANs and VAEs paradigms, but the outputs are sometimes limited to low-resolution and lack of diversity. In this work, we propose Additive Focal Variational Auto-encoder (AF-VAE), a novel approach that can arbitrarily manipulate high-resolution face images using a simple yet effective model and only weak supervision of reconstruction and KL divergence losses. First, a novel additive Gaussian Mixture assumption is introduced with an unsupervised clustering mechanism in the structural latent space, which endows better disentanglement and boosts multi-modal representation with external memory. Second, to improve the perceptual quality of synthesized results, two simple strategies in architecture design are further tailored and discussed on the behavior of Human Visual System (HVS) for the first time, allowing for fine control over the model complexity and sample quality. Human opinion studies and new state-of-the-art Inception Score (IS) / Frechet Inception Distance (FID) demonstrate the superiority of our approach over existing algorithms, advancing both the fidelity and extremity of face manipulation task.
研究动机与目标
- 解决现有面部操控方法在非受控条件下生成高保真度、多样化且极端的面部变换时的局限性。
- 克服标准VAE因使用单位高斯潜在先验而导致的表征解耦性差与多样性有限的问题。
- 通过基于人类视觉系统(HVS)行为的架构设计,提升生成面部的感知质量。
- 仅使用重建损失与KL散度损失,实现稳定、可控且身份保持的面部操控。
提出的方法
- 提出一种加法聚焦变分自编码器(AF-VAE),将潜在空间分离为外观与结构表征,以实现更好的解耦。
- 采用无监督聚类机制,引导结构潜在空间中的新型加法高斯混合先验,增强多模态表征与多样性。
- 引入轻量级记忆模块,将聚类结果与先验相连接,支持生成多样化的面部表情与姿态。
- 设计一种结合像素洗牌与权重归一化的生成器,以提升感知质量,其设计基于对人类视觉系统(HVS)敏感度的实证分析。
- 仅使用重建损失与KL散度损失进行训练,实现稳定优化,无需复杂的对抗训练或辅助监督。
- 应用基于几何的解耦机制,显式地将姿态无关的外观表征与结构成分从潜在空间中分离。
实验结果
研究问题
- RQ1仅基于简单VAE框架,能否在不使用对抗训练或复杂损失项的情况下实现高保真度面部操控?
- RQ2在仅使用弱监督的情况下,如何在面部操控的潜在空间中实现解耦且多模态的表征?
- RQ3基于人类视觉系统(HVS)的架构设计选择,能在多大程度上提升生成面部的感知质量?
- RQ4在仅使用结构与外观解耦的情况下,能否在极端面部操控中保持身份一致性?
- RQ5各个组件(GMM、像素洗牌、权重归一化)对模型整体性能的贡献如何?
主要发现
- AF-VAE在CelebA数据集上实现了36.82的Fréchet Inception Distance(FID)与2.15的Inception Score(IS),显著优于先前的最先进方法。
- 消融实验表明,若移除任意一个组件(GMM、像素洗牌、权重归一化或KL散度),FID与IS均出现可测量的下降。
- 潜在向量之间的插值生成了在外观与结构上均平滑、逼真的过渡,表明特征学习具有高密度与良好解耦性。
- 当使用与源图像具有相似面部轮廓的边界图进行条件控制时,模型能成功保持身份特征;但当轮廓差异显著时则失败。
- 失败案例揭示了在处理稀有物体、遮挡与风格化输入时的局限性,常因强结构一致性导致模糊或不自然的形变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。