Skip to main content
QUICK REVIEW

[论文解读] CLIP2StyleGAN: Unsupervised Extraction of StyleGAN Edit Directions

Rameen Abdal, Peihao Zhu|arXiv (Cornell University)|Dec 9, 2021
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

CLIP2StyleGAN 提出了一种无监督方法,通过利用 CLIP 的视觉-语言嵌入,从 StyleGAN 中提取并标注解耦的语义编辑方向。该方法可自动识别出有意义且带有语义标签的编辑方向,如 '男性/女性'、'微笑/不微笑' 以及 '报废/烧毁/焦黑',而无需人工标注属性,从而实现在 GAN 中的零样本、数据驱动语义编辑。

ABSTRACT

The success of StyleGAN has enabled unprecedented semantic editing capabilities, on both synthesized and real images. However, such editing operations are either trained with semantic supervision or described using human guidance. In another development, the CLIP architecture has been trained with internet-scale image and text pairings and has been shown to be useful in several zero-shot learning settings. In this work, we investigate how to effectively link the pretrained latent spaces of StyleGAN and CLIP, which in turn allows us to automatically extract semantically labeled edit directions from StyleGAN, finding and naming meaningful edit operations without any additional human guidance. Technically, we propose two novel building blocks; one for finding interesting CLIP directions and one for labeling arbitrary directions in CLIP latent space. The setup does not assume any pre-determined labels and hence we do not require any additional supervised text/attributes to build the editing framework. We evaluate the effectiveness of the proposed method and demonstrate that extraction of disentangled labeled StyleGAN edit directions is indeed possible, and reveals interesting and non-trivial edit directions.

研究动机与目标

  • 实现无需人工标注属性或监督的 StyleGAN 中语义有意义编辑方向的无监督发现。
  • 将预训练的 StyleGAN 和 CLIP 的潜在空间进行关联,以联合分析图像与文本表征。
  • 利用 CLIP 的文本嵌入自动标注编辑方向,避免人工整理或后期标注。
  • 从人脸图像中提取解耦的、与感知相关的重要属性,如性别、年龄和面部表情。
  • 将发现的基于 CLIP 的方向迁移至 StyleGAN 的潜在空间,实现可控的、语义化的图像编辑。

提出的方法

  • 使用 CLIP 的图像和文本编码器,对一组生成图像或真实图像及其对应的文本提示进行嵌入。
  • 对 CLIP 图像嵌入应用主成分分析(PCA),以识别捕捉数据显著变化的主要方向。
  • 针对每个主方向,使用 CLIP 的文本编码器分类最显著的文本概念,以自然语言术语标注该方向。
  • 通过向 CLIP 输入一组结构化文本模板(例如,'一张 {} 人的照片','一辆 {} 汽车的照片')来优化模糊或多概念方向。
  • 使用线性投影将发现的 CLIP 方向投影到 StyleGAN 的 W+ 潜在空间,以支持语义编辑。
  • 结合 PCA 与基于文本的优化方法,以提升提取方向的解耦性和标签准确性。

实验结果

研究问题

  • RQ1CLIP 的视觉-语言嵌入能否在无监督条件下自动发现 StyleGAN 中有意义且带语义标签的编辑方向?
  • RQ2在 CLIP 图像嵌入上应用 PCA,是否能有效识别出潜在空间中数据驱动的、与感知相关的方向?
  • RQ3该方法能否利用 CLIP 的文本编码器将复杂、多概念的方向解耦为独立且可解释的编辑方向?
  • RQ4自动提取的标签在语义相关性和可解释性方面,与人类识别的属性相比表现如何?
  • RQ5在修改特定属性(尤其是性别或种族等敏感属性)时,生成的编辑在多大程度上保持了身份一致性?

主要发现

  • 该方法在 FFHQ 数据集上成功提取了 20 个主要语义方向,包括 '男性/女性'、'微笑/不微笑' 和 '儿童',且语义一致性高。
  • 在 LSUN-CAR 数据集上,该方法发现了一个新颖且有意义的方向,被标注为 '报废/烧毁/焦黑',此前未被用于编辑。
  • 用户研究表明,CLIP2StyleGAN 自动生成的标签在质量上与人工标注的标签相当,验证了该方法的可解释性。
  • 身份一致性在编辑过程中得到保持:面部嵌入的余弦相似度在大多数编辑中保持在 0.93 以上,属性分类准确率为 0.90–1.00。
  • 该方法揭示了训练数据中的潜在偏见,如主导的种族或职业标签,突显了伦理问题,并展示了检测数据偏见的潜力。
  • 与 GANSpace 方法相比,CLIP2StyleGAN 的编辑在 '性别/男性' 方向上的分类准确率更高,但视觉变化较小,表明 CLIP2StyleGAN 生成的编辑更具影响力且语义更明确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。