[论文解读] Semi-Supervised StyleGAN for Disentanglement Learning
本文提出Semi-StyleGAN,一种基于StyleGAN的半监督生成模型,在高分辨率的合成与真实图像上仅使用0.25%–2.5%的标注数据,即可实现接近完全监督的解耦质量。通过整合互信息损失和新型生成器可控性度量,揭示了解耦表征学习与可控生成之间的关键权衡,同时支持可泛化的语义细粒度图像编辑。
Disentanglement learning is crucial for obtaining disentangled representations and controllable generation. Current disentanglement methods face several inherent limitations: difficulty with high-resolution images, primarily focusing on learning disentangled representations, and non-identifiability due to the unsupervised setting. To alleviate these limitations, we design new architectures and loss functions based on StyleGAN (Karras et al., 2019), for semi-supervised high-resolution disentanglement learning. We create two complex high-resolution synthetic datasets for systematic testing. We investigate the impact of limited supervision and find that using only 0.25%~2.5% of labeled data is sufficient for good disentanglement on both synthetic and real datasets. We propose new metrics to quantify generator controllability, and observe there may exist a crucial trade-off between disentangled representation learning and controllable generation. We also consider semantic fine-grained image editing to achieve better generalization to unseen images.
研究动机与目标
- 解决无监督解耦方法的局限性,包括不可识别性以及在高分辨率图像上的可扩展性差的问题。
- 通过在生成器层面评估解耦质量,弥合解耦表征学习与可控图像生成之间的差距。
- 在复杂且高分辨率的数据集上,实现仅用极少监督的半监督解耦学习。
- 开发一种方法,通过语义细粒度图像编辑实现对未见图像的泛化。
- 创建新的高质量、高分辨率合成数据集,作为解耦研究的基准。
提出的方法
- 在StyleGAN中引入互信息损失(Info-StyleGAN),以提升无监督解耦性能。
- 提出Semi-StyleGAN,采用混合训练目标,结合无监督GAN损失与在有限标注数据上的监督对比损失。
- 设计改进的生成器架构Semi-StyleGAN-fine,用新型输入模块替代低分辨率块,以实现细粒度风格控制。
- 训练编码器,从输入图像的32×32下采样版本中预测细粒度因子编码。
- 引入新型评估指标——MIG-gen和L2-gen,用于量化生成器的可控性与解耦质量。
- 将模型扩展至图像到图像设置,实现对新测试图像的语义细粒度编辑,具备良好泛化能力。
实验结果
研究问题
- RQ1在仅使用极少标注数据的情况下,半监督学习能否显著提升高分辨率图像上的解耦质量?
- RQ2解耦表征的质量是否与生成器可控性相关,还是存在根本性的权衡?
- RQ3基于半监督StyleGAN的模型在潜在空间遍历中是否能实现对未见图像的细粒度控制与泛化?
- RQ4新型指标如MIG-gen和L2-gen与标准基于编码器的指标相比,在评估解耦性方面表现如何?
- RQ5在多大程度上,有限的监督(0.25%–2.5%)可实现接近完全监督解耦的性能?
主要发现
- Info-StyleGAN在高分辨率数据上的解耦质量优于大多数最先进无监督解耦方法。
- Semi-StyleGAN在合成与真实数据集上仅使用0.25%至2.5%的标注数据,即可实现接近完全监督的解耦性能。
- 所提出的MIG-gen和L2-gen指标揭示了解耦表征学习与可控图像生成之间的关键权衡。
- Semi-StyleGAN-fine在仅使用1%标注数据的情况下,实现了对未见测试图像的泛化细粒度图像编辑,同时保持身份一致性和高图像质量。
- 当标注率超过1%后,性能不再显著提升,表明样本效率已达到饱和。
- 该方法在新内容上泛化良好,例如在Isaac3D中实现新机器人位置和未见物体的泛化,在CelebA中实现新面部身份的泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。