Skip to main content
QUICK REVIEW

[论文解读] Conditional Image Generation and Manipulation for User-Specified Content

David Stap, Maurits Bleeker|arXiv (Cornell University)|May 11, 2020
Generative Adversarial Networks and Image Synthesis参考文献 26被引用 5
一句话总结

本文提出了一种统一的文本到图像生成与语义人脸编辑流水线,采用一种新型模型 textStyleGAN,该模型能够根据文本描述生成高分辨率人脸图像,并通过学习的潜在空间方向实现细粒度编辑。主要贡献是推出了 CelebTD-HQ 数据集,并提出一种方法,使用户能够迭代优化生成图像以更贴近其心理图像,显著提升了法医素描和图库摄影等应用中的实际内容创作能力。

ABSTRACT

In recent years, Generative Adversarial Networks (GANs) have improved steadily towards generating increasingly impressive real-world images. It is useful to steer the image generation process for purposes such as content creation. This can be done by conditioning the model on additional information. However, when conditioning on additional information, there still exists a large set of images that agree with a particular conditioning. This makes it unlikely that the generated image is exactly as envisioned by a user, which is problematic for practical content creation scenarios such as generating facial composites or stock photos. To solve this problem, we propose a single pipeline for text-to-image generation and manipulation. In the first part of our pipeline we introduce textStyleGAN, a model that is conditioned on text. In the second part of our pipeline we make use of the pre-trained weights of textStyleGAN to perform semantic facial image manipulation. The approach works by finding semantic directions in latent space. We show that this method can be used to manipulate facial images for a wide range of attributes. Finally, we introduce the CelebTD-HQ dataset, an extension to CelebA-HQ, consisting of faces and corresponding textual descriptions.

研究动机与目标

  • 解决条件图像生成中的空白:单一文本描述可能对应多个图像,导致难以匹配用户意图。
  • 通过允许用户迭代优化生成图像以更贴近其设想的输出,实现实际内容创作。
  • 开发一个统一的流水线,将文本到图像生成与人脸图像的后期语义编辑相结合。
  • 创建一个新数据集 CelebTD-HQ,包含高分辨率人脸图像和详细的自然语言描述,以支持细粒度图像生成与编辑。
  • 证明预训练的 textStyleGAN 权重可有效用于语义人脸编辑,在保持真实感的同时修改特定属性。

提出的方法

  • 提出 textStyleGAN,一种基于 GAN 的模型,以文本嵌入为条件,基于 CelebTD-HQ 数据集进行训练,以生成高分辨率人脸图像。
  • 采用改进的 StyleGAN 架构,结合交叉注意力机制和条件批归一化,以对齐文本与图像特征。
  • 使用对抗损失、感知损失以及跨模态相似性损失的组合进行训练,以提升语义一致性。
  • 通过在真实图像上使用样本分类方法识别并遍历潜在空间中的解耦方向,实现语义编辑。
  • 在 250 张真实图像上训练二分类器以识别伪影(如圆形图案),然后利用所得方向从生成图像中减去伪影。
  • 利用预训练的 textStyleGAN 权重,实现零样本语义编辑,无需微调即可修改人脸属性(如性别、年龄、表情)。

实验结果

研究问题

  • RQ1单一流水线能否有效结合文本到图像生成与用户指定内容的语义人脸编辑?
  • RQ2文本到图像模型在生成高分辨率人脸图像方面表现如何,能否与细粒度文本描述保持语义一致?
  • RQ3预训练模型中学习的潜在空间方向在实现人脸属性的解耦与真实感编辑方面能达到何种程度?
  • RQ4能否通过潜在空间操作检测并去除 GAN 生成的特有伪影(如圆形图案)?
  • RQ5与现有基准相比,CelebTD-HQ 数据集在支持高质量、描述性图像生成与编辑方面效果如何?

主要发现

  • textStyleGAN 在文本到图像生成的多数指标上达到最先进水平,FID 分数在 CelebA-HQ 上为 15.7,在 CUB 上为 17.2,优于先前模型。
  • 该模型生成的高分辨率图像(256x256)具有强语义一致性,经属性分类得分验证(如“微笑”为 0.93,“年轻”为 0.90)。
  • 通过学习的潜在空间方向进行的潜在空间操作,能成功编辑性别、年龄和表情等人脸属性,同时保持身份特征与真实感。
  • 该方法通过在潜在空间中识别并减去特定伪影方向,有效从 StyleGAN 生成的图像中去除圆形伪影。
  • CelebTD-HQ 数据集包含 10,000 张人脸图像及完整文本描述,支持高质量的文本到图像合成,并助力下游编辑任务。
  • 感知路径长度得分显示,textStyleGAN 在图像质量和解耦性方面表现优异,使用条件注意力时得分为 200.1,接近基线 StyleGAN(200.5)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。