[论文解读] BlendGAN: Implicitly GAN Blending for Arbitrary Stylized Face Generation
BlendGAN 提出了一种统一的 GAN 框架,用于通过自监督风格编码器和加权混合模块(WBM)实现任意风格化人脸生成,该模块隐式结合人脸和风格潜在码,无需针对特定风格进行微调即可实现高保真度、多样化的风格化。该方法在参考引导和潜在引导生成任务上分别取得了 3.79 和 15.08 的 SOTA FID 分数,使用了新型大规模艺术人脸数据集(AAHQ)。
Generative Adversarial Networks (GANs) have made a dramatic leap in high-fidelity image synthesis and stylized face generation. Recently, a layer-swapping mechanism has been developed to improve the stylization performance. However, this method is incapable of fitting arbitrary styles in a single model and requires hundreds of style-consistent training images for each style. To address the above issues, we propose BlendGAN for arbitrary stylized face generation by leveraging a flexible blending strategy and a generic artistic dataset. Specifically, we first train a self-supervised style encoder on the generic artistic dataset to extract the representations of arbitrary styles. In addition, a weighted blending module (WBM) is proposed to blend face and style representations implicitly and control the arbitrary stylization effect. By doing so, BlendGAN can gracefully fit arbitrary styles in a unified model while avoiding case-by-case preparation of style-consistent training images. To this end, we also present a novel large-scale artistic face dataset AAHQ. Extensive experiments demonstrate that BlendGAN outperforms state-of-the-art methods in terms of visual quality and style diversity for both latent-guided and reference-guided stylized face synthesis.
研究动机与目标
- 解决现有基于 GAN 的风格化方法的局限性,即需要为每种风格单独训练,并依赖数百张风格一致的图像。
- 实现单一统一模型,无需重新训练或微调即可为任意艺术风格生成风格化人脸。
- 开发一种灵活、可控的混合机制,通过调节潜在码交互来调整风格化强度。
- 引入大规模、多样化的艺术人脸数据集(AAHQ),以支持通用风格表征的训练。
- 在潜在引导和参考引导风格化人脸生成中均实现高视觉质量与风格一致性。
提出的方法
- 在 AAHQ 数据集上使用实例对比学习训练自监督风格编码器,从艺术人脸图像中提取解耦的风格表征。
- 引入加权混合模块(WBM),通过可学习的混合权重隐式融合来自标准高斯分布的人脸潜在码和风格潜在码。
- 使用三个判别器:一个用于自然人脸图像(D_face),一个用于风格化人脸图像(D_style),一个用于风格-潜在码一致性(D_style_latent)。
- 采用两阶段训练策略:首先在 AAHQ 上预训练风格编码器,然后在 FFHQ 和 AAHQ 上联合训练生成器、WBM 和判别器。
- 通过将 WBM 条件于随机潜在码或参考图像的风格码,实现潜在引导和参考引导生成。
- 利用 WBM 的指示器控制人脸与风格特征之间的混合比例,实现精细的风格化控制。
实验结果
研究问题
- RQ1单一 GAN 模型是否能够在无需特定风格微调或大规模风格一致数据集的情况下,为任意艺术风格生成风格化人脸?
- RQ2在通用艺术数据集上预训练的自监督风格编码器,在捕捉多样化且解耦的风格表征方面效果如何?
- RQ3加权混合模块在实现可控、隐式融合人脸与风格潜在码方面,对高保真度风格化的作用有多大?
- RQ4所提出的框架在潜在引导和参考引导设置下,是否在视觉质量和风格多样性方面均优于现有方法?
- RQ5该模型是否能在未见风格上实现良好泛化,且在与参考图像保持风格一致性方面表现如何?
主要发现
- BlendGAN 在参考引导风格化人脸生成任务上实现了 3.79 的 Fréchet Inception Distance(FID)分数,显著优于先前的 SOTA 方法。
- 在潜在引导生成任务上,BlendGAN 的 FID 得分为 15.08,表明其在生成多样化且高质量风格化人脸方面表现卓越。
- BlendGAN 的 LPIPS 分数在所有对比方法中最高,表明其在风格多样性和与参考风格的感知相似性方面表现更优。
- 该模型在不同肤色的人脸上均保持高质量生成,未表现出对浅肤色人脸的显著偏见,这与某些在 FFHQ 上训练的早期 GAN 不同。
- 加权混合模块实现了对风格化强度的有效控制,即使在高混合比例下仍能保持良好的视觉质量。
- 由于 AAHQ 数据集的通用性以及自监督风格编码器的设计,该框架在未见艺术风格上表现出良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。