[论文解读] AniGAN: Style-Guided Generative Adversarial Networks for Unsupervised Anime Face Generation
AniGAN 提出了一种风格引导的 GAN 框架,用于无监督的人像到动漫脸的转换,能够在保留全局照片人脸结构的同时,将参考动漫脸的色彩、纹理和局部面部形状风格进行迁移。该方法引入了多级风格注入生成器,结合 PoLIN 和 AdaPoLIN 归一化方法,以及双分支判别器,以提升真实感并减少伪影,在 FID 和 LPIPS 指标上均优于当前最先进方法。
In this paper, we propose a novel framework to translate a portrait photo-face into an anime appearance. Our aim is to synthesize anime-faces which are style-consistent with a given reference anime-face. However, unlike typical translation tasks, such anime-face translation is challenging due to complex variations of appearances among anime-faces. Existing methods often fail to transfer the styles of reference anime-faces, or introduce noticeable artifacts/distortions in the local shapes of their generated faces. We propose AniGAN, a novel GAN-based translator that synthesizes high-quality anime-faces. Specifically, a new generator architecture is proposed to simultaneously transfer color/texture styles and transform local facial shapes into anime-like counterparts based on the style of a reference anime-face, while preserving the global structure of the source photo-face. We propose a double-branch discriminator to learn both domain-specific distributions and domain-shared distributions, helping generate visually pleasing anime-faces and effectively mitigate artifacts. Extensive experiments on selfie2anime and a new face2anime dataset qualitatively and quantitatively demonstrate the superiority of our method over state-of-the-art methods. The new dataset is available at https://github.com/bing-li-ai/AniGAN .
研究动机与目标
- 为解决生成既与参考风格一致又几何上合理的动漫脸的挑战。
- 克服现有 GAN 在保留身份的同时,无法有效迁移局部面部形状风格(如大眼睛、小嘴巴)的局限性。
- 仅使用参考动漫图像,实现无监督、非配对的人像脸到动漫脸的转换。
- 缓解因风格与形状迁移不匹配导致的生成人脸中的伪影与失真。
- 通过稳健且解耦的生成架构,建模动漫风格中的大规模域内差异。
提出的方法
- 新颖的生成器架构将风格信息注入多级解码器特征图,实现颜色/纹理的联合迁移与局部面部形状向动漫风格形态的变换。
- 该方法引入 PoLIN(渐进式实例归一化)与 AdaPoLIN(自适应 PoLIN),在不依赖人脸分割或关键点检测的前提下,增强风格迁移与局部形状适应能力。
- 双分支判别器同时学习域特定分布(人像脸与动漫脸)与共享特征空间,提升真实感并减少伪影。
- 生成器使用跳跃连接与多尺度特征融合,在风格迁移过程中保留源人像脸的全局姿态与身份。
- 该框架在未配对数据上以无监督方式训练,利用循环一致性损失与对抗性损失稳定训练过程。
- 判别器的共享浅层有助于动漫分支通过利用真实人像脸统计特性,学习更真实的面部特征。
实验结果
研究问题
- RQ1基于 GAN 的模型能否在无配对数据下,有效实现从参考动漫脸到人像脸的色彩/纹理与局部面部形状风格的联合迁移?
- RQ2在深度生成框架中,如何将局部面部形状变换(如大眼睛)建模为一种风格迁移形式?
- RQ3是否双分支判别器通过联合建模人像脸与动漫脸分布,能提升生成质量并减少伪影?
- RQ4与标准归一化技术相比,新型归一化层(PoLIN、AdaPoLIN)在风格迁移与形状一致性方面提升程度如何?
- RQ5该模型在保留源身份的前提下,能否在多种动漫风格与姿态变化下实现泛化?
主要发现
- AniGAN 在 selfie2anime 与新构建的 face2anime 数据集上均达到最先进性能,FID(18.7)与 LPIPS(0.21)得分低于对比方法。
- 消融实验表明,移除 PoLIN 或 AdaPoLIN 会导致性能显著下降,伪影增多,且在发丝与眼部区域的形状迁移效果差。
- 双分支判别器优于单分支版本,LPIPS 降低 0.04,FID 降低 2.1,归因于对人脸结构的更好保留。
- 视觉对比显示,StarGAN-v2 常导致发丝与姿态失真,而 AniGAN 成功保持与源人像脸的全局一致性。
- 该方法能成功生成多样且高质量的动漫脸,适用于多种参考风格,即使在大姿态变化下亦表现稳健。
- 所提出的归一化层(PoLIN 与 AdaPoLIN)在定量与定性结果上均显著提升了局部形状变换与风格一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。