Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Discovery of Disentangled Manifolds in GANs

Yu-Ding Lu, Hsin-Ying Lee|arXiv (Cornell University)|Nov 24, 2020
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

该论文提出了一种无监督框架,通过从单热属性向量学习到潜在码的变换并应用中心点损失以增强平滑性和一致性,从而在预训练的 GAN 潜在空间中发现解耦且可解释的方向。该方法实现了可控的、属性特定的图像编辑,在多种数据集和模型上均提升了感知路径长度和重建精度。

ABSTRACT

As recent generative models can generate photo-realistic images, people seek to understand the mechanism behind the generation process. Interpretable generation process is beneficial to various image editing applications. In this work, we propose a framework to discover interpretable directions in the latent space given arbitrary pre-trained generative adversarial networks. We propose to learn the transformation from prior one-hot vectors representing different attributes to the latent space used by pre-trained models. Furthermore, we apply a centroid loss function to improve consistency and smoothness while traversing through different directions. We demonstrate the efficacy of the proposed framework on a wide range of datasets. The discovered direction vectors are shown to be visually corresponding to various distinct attributes and thus enable attribute editing.

研究动机与目标

  • 实现对预训练 GAN 潜在空间中解耦且可解释方向的无监督发现,以支持可控图像编辑。
  • 解决 GAN 潜在空间中属性操作不一致且不平滑的挑战,且无需微调或监督。
  • 通过一种新颖的基于中心点的正则化方法,提升沿发现方向的图像过渡的一致性和平滑性。
  • 在多样化的数据集(动漫人脸、ILSVRC-ImageNet、FFHQ)和预训练模型(SNGAN、BigGAN、StyleGAN2)上验证该方法。

提出的方法

  • 训练一个形变网络 $A$,从原始图像和通过连续潜在向量加法生成的两个偏移图像中,预测潜在码偏移的方向和尺度。
  • 使用一个重构网络 $R$,从原始图像和偏移图像中预测属性标签 $k$ 和偏移幅度 $\varepsilon$,从而实现端到端训练。
  • 引入一种中心点损失,促使属于同一属性方向 $k$ 的所有偏移潜在码都接近该方向所学习到的中心点。
  • 通过在潜在空间中添加偏移码(例如 StyleGAN2 中的 $W$-空间)将该框架应用于预训练生成器,实现在不微调的情况下进行属性特定的编辑。
  • 通过对比学习和中心点正则化,联合训练形变网络和重构网络,以提升解耦性和一致性。
  • 采用两阶段图像生成过程:首先从 $z$ 移动到 $z + A(k_1, \varepsilon_1)$,然后移动到 $z + A(k_1, \varepsilon_1) + A(k_2, \varepsilon_2)$,从而实现多属性过渡。

实验结果

研究问题

  • RQ1我们能否在不依赖监督或微调的情况下,无监督地发现预训练 GAN 潜在空间中的解耦、可解释方向?
  • RQ2在图像生成过程中,如何提升潜在空间中属性过渡的平滑性和一致性?
  • RQ3引入中心点损失是否能有效提升对应同一属性的潜在码聚类效果,从而增强可编辑性?
  • RQ4所提出的方法是否能在不同数据集(如 FFHQ、ILSVRC-ImageNet、动漫人脸)和不同预训练 GAN 架构(BigGAN、StyleGAN2、SNGAN)上实现泛化?
  • RQ5与基线无监督 GAN 解耦方法相比,该方法在感知质量和解耦性方面提升了多少?

主要发现

  • 在 BigGAN-FFHQ 上,该方法的感知路径长度(PPL)达到 99.78,显著低于基线的 179.23,表明图像过渡更平滑且感知上更一致。
  • 在 ILSVRC-ImageNet 数据集上的 BigGAN 中,该方法的重构器分类准确率(RCA)达到 0.85,优于基线(0.84)和无中心点损失的消融实验(0.86),证明了解耦性得到提升。
  • 在 FFHQ 上使用 StyleGAN2 时,该方法的 PPL 为 402.64,RCA 为 0.82,表明在高分辨率、复杂人脸生成中表现稳定。
  • 中心点损失有效降低了潜在码的类内方差,表现为更低的 PPL 值以及在多次试验中属性变化的一致性更高。
  • 定性结果表明,该方法成功发现了多样且语义有意义的属性,如发色、发型和眼镜,且在不同方向间实现了平滑过渡。
  • 该方法在不同 GAN 架构和数据集上均表现出泛化能力,表现为在动漫人脸、ILSVRC-ImageNet 和 FFHQ 上,定量指标和视觉质量均持续提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。