Skip to main content
QUICK REVIEW

[论文解读] SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing

Yichun Shi, Xiao Yang|arXiv (Cornell University)|Dec 3, 2021
Generative Adversarial Networks and Image Synthesis被引用 8
一句话总结

SemanticStyleGAN 提出了一种组合式 GAN 架构,通过使用专用潜在码对局部语义部件(例如眼睛、头发、嘴巴)进行建模,实现了潜在空间的解耦,从而实现了对结构和纹理的细粒度控制。通过联合使用图像和分割掩码进行训练,该方法实现了更优的解耦效果,并在与现有基于 StyleGAN 的方法结合时,实现了更精确的编辑。

ABSTRACT

Recent studies have shown that StyleGANs provide promising prior models for downstream tasks on image synthesis and editing. However, since the latent codes of StyleGANs are designed to control global styles, it is hard to achieve a fine-grained control over synthesized images. We present SemanticStyleGAN, where a generator is trained to model local semantic parts separately and synthesizes images in a compositional way. The structure and texture of different local parts are controlled by corresponding latent codes. Experimental results demonstrate that our model provides a strong disentanglement between different spatial areas. When combined with editing methods designed for StyleGANs, it can achieve a more fine-grained control to edit synthesized or real images. The model can also be extended to other domains via transfer learning. Thus, as a generic prior model with built-in disentanglement, it could facilitate the development of GAN-based applications and enable more potential downstream tasks.

研究动机与目标

  • 为了解决 StyleGAN 中全局潜在码影响整个图像、缺乏细粒度控制的问题。
  • 开发一种生成先验,实现对局部语义区域(例如眼睛、头发)的解耦操控,且不受全局干扰。
  • 在初始使用分割掩码进行预训练后,仅使用图像数据即可实现向新领域(例如时尚、动漫)的迁移学习。
  • 与现有基于 StyleGAN 的编辑方法结合,实现增强的、局部化的图像编辑能力。

提出的方法

  • 生成器使用一组局部生成器,每个局部生成器负责一个由分割掩码定义的语义部件。
  • 每个局部生成器都由一个专用潜在码控制,该潜在码同时调控其对应部件的形状和纹理。
  • 通过掩码融合聚合局部生成器的特征,以合成最终图像。
  • 模型采用端到端训练,使用联合目标同时建模图像重建和语义分割掩码的一致性。
  • 通过按语义区域分离特征调制,该架构强制实现空间解耦,减少跨区域干扰。
  • 通过在仅含图像的数据集上微调,模型支持迁移学习,同时保持局部解耦性。
(a)
(a)

实验结果

研究问题

  • RQ1能否训练 GAN 在保持高图像质量的同时,实现潜在空间中局部语义部件的解耦?
  • RQ2与全局 StyleGAN 控制相比,局部潜在码是否能实现对特定图像区域更精确的编辑?
  • RQ3在仅使用图像数据的新领域微调时,模型是否能有效保留空间解耦性?
  • RQ4该模型与现有基于 StyleGAN 的编辑方法结合后,能否实现更优的可控性?
  • RQ5该模型在非人脸领域(如时尚或卡通图像)中的泛化能力如何?

主要发现

  • SemanticStyleGAN 实现了空间区域之间的强解耦,实现了对局部部件结构和纹理的独立控制。
  • 当与基于优化的编辑方法(例如 StyleCLIP)结合时,该模型能够实现忠实且局部化的编辑,准确遵循用户指定的区域。
  • 即使在微调阶段未使用分割掩码,该模型在 Toonify、MetFaces 和 BitMoji 等仅含图像的数据集上微调后,仍能保持局部解耦性。
  • 该模型成功泛化至非人脸领域,例如 DeepFashion,能够实现对每个语义部件的可控生成,生成多样化的服装风格。
  • 该方法实现了高质量的图像生成,并具备改进的可编辑性,定性结果表明其能实现准确的局部变化,且无全局伪影。
  • 在局部编辑任务中,该模型优于标准 StyleGAN,特别是在编辑发型或面部特征时,能将非预期变化降至最低。
(b)
(b)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。