[论文解读] CoDeGAN: Contrastive Disentanglement for Generative Adversarial Network
本文提出 CD-GAN,一种新颖的对比解缠框架,用于生成对抗网络,通过对比学习解耦视觉数据中的类间变化因素。通过在与类别相关的特征上使用对比损失,并利用少量带标签的锚点图像进行有限监督,CD-GAN 实现了最先进的无监督解缠性能,且仅需 1–2% 的标注数据即可显著提升性能。
Disentanglement, a critical concern in interpretable machine learning, has also garnered significant attention from the computer vision community. Many existing GAN-based class disentanglement (unsupervised) approaches, such as InfoGAN and its variants, primarily aim to maximize the mutual information (MI) between the generated image and its latent codes. However, this focus may lead to a tendency for the network to generate highly similar images when presented with the same latent class factor, potentially resulting in mode collapse or mode dropping. To alleviate this problem, we propose exttt{CoDeGAN} (Contrastive Disentanglement for Generative Adversarial Networks), where we relax similarity constraints for disentanglement from the image domain to the feature domain. This modification not only enhances the stability of GAN training but also improves their disentangling capabilities. Moreover, we integrate self-supervised pre-training into CoDeGAN to learn semantic representations, significantly facilitating unsupervised disentanglement. Extensive experimental results demonstrate the superiority of our method over state-of-the-art approaches across multiple benchmarks. The code is available at https://github.com/learninginvision/CoDeGAN.
研究动机与目标
- 为解决 GAN 中缺乏概率推理和样本似然性而导致的解缠表征学习挑战。
- 探索一种基于对比学习的新型 GAN 类间解缠范式,其灵感源于相同因子值会产生相似图像特征的直觉。
- 在复杂数据分布中最大化有限监督的效用,尤其在解缠任务中。
- 通过对比损失设计提升训练稳定性并防止模式崩溃。
提出的方法
- 提出一种对比解缠框架(CD-GAN),包含生成器、判别器和编码器,其中生成器使用连续内容码 z 和独热因子码 c。
- 采用对比损失,将带标签的真实图像作为锚点,对比生成图像与同类别或不同类别的真实图像的特征。
- 同时使用 ℓ₂ 损失和对比损失监督编码器,确保同类别图像的特征被拉近,不同类别图像的特征被推远。
- 利用对比损失隐式引导生成器生成类别一致的样本,即使没有显式的似然性或后验推理。
- 将该框架应用于多个数据集,包括 MNIST、Fashion-MNIST、CIFAR-10、dSprites 和 Faces,并通过消融实验评估标签效率。
- 采用 SNGAN 架构,并使用标准指标评估性能:准确率(ACC)、归一化互信息(NMI)、调整兰德指数(ARI)、FID 和 Inception Score(IS)。
实验结果
研究问题
- RQ1对比学习能否在不依赖概率推理的情况下,有效应用于 GAN 中类间因素的解缠?
- RQ2如何最大化有限监督在 GAN 基模型中的效用,以提升解缠性能?
- RQ3对比损失是否有助于稳定 GAN 训练并缓解模式崩溃?
- RQ4CD-GAN 是否能在无监督和弱监督设置下实现最先进的解缠性能?
主要发现
- 在 MNIST 上,CD-GAN 实现了最先进的无监督解缠性能,准确率为 0.91,NMI 为 0.93,ARI 为 0.94,优于 InfoGAN 和 ClusterGAN。
- 在 Fashion-MNIST 上,CD-GAN 在无监督设置下达到 0.66 ACC、0.62 NMI 和 0.53 ARI,显著优于基线方法。
- 仅使用 1–2% 的标注数据,CD-GAN 显著提升了性能,在 Fashion-MNIST 上达到 0.82 ACC、0.72 NMI 和 0.68 ARI。
- 在复杂的 CIFAR-10 数据集上,CD-GAN 使用 5% 的标签即达到 0.41 ACC、7.65 IS 和 23.97 FID,显著优于无监督基线,且与有监督方法具有竞争力。
- 对比损失设计通过将真实带标签图像作为锚点,实现了更好的特征分离与生成图像的校准,提升了泛化能力和解缠效果。
- CD-GAN 展现出更优的训练稳定性和更少的模式崩溃,归因于对比损失促进了生成样本的多样性和一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。