[论文解读] Contrastive Fine-grained Class Clustering via Generative Adversarial Networks
C3-GAN 提出了一种基于 GAN 的新颖方法,通过结合 InfoGAN 的类别推理与对比学习,实现无监督细粒度类别聚类,以学习有利于聚类的嵌入空间。该方法在四个细粒度数据集上实现了最先进性能,同时通过使用图像-潜在变量对作为正样本和负样本训练判别器以优化对比损失,有效缓解了模式崩溃问题。
Unsupervised fine-grained class clustering is a practical yet challenging task due to the difficulty of feature representations learning of subtle object details. We introduce C3-GAN, a method that leverages the categorical inference power of InfoGAN with contrastive learning. We aim to learn feature representations that encourage a dataset to form distinct cluster boundaries in the embedding space, while also maximizing the mutual information between the latent code and its image observation. Our approach is to train a discriminator, which is also used for inferring clusters, to optimize the contrastive loss, where image-latent pairs that maximize the mutual information are considered as positive pairs and the rest as negative pairs. Specifically, we map the input of a generator, which was sampled from the categorical distribution, to the embedding space of the discriminator and let them act as a cluster centroid. In this way, C3-GAN succeeded in learning a clustering-friendly embedding space where each cluster is distinctively separable. Experimental results show that C3-GAN achieved the state-of-the-art clustering performance on four fine-grained image datasets, while also alleviating the mode collapse phenomenon. Code is available at https://github.com/naver-ai/c3-gan.
研究动机与目标
- 为解决无监督细粒度类别聚类的挑战,其中类别之间的细微视觉差异使得表示学习变得困难。
- 克服现有自监督学习方法的局限性,这些方法因数据增强而将细粒度差异视为噪声。
- 消除对人工标注边界框或分类器的依赖,使方法可应用于多样化、未经整理的数据集。
- 通过一种对比正则化方案缓解模式崩溃,提升 GAN 训练的稳定性。
- 学习一个解耦的、有利于聚类的嵌入空间,使得每个类别形成一个独立且线性可分的聚类。
提出的方法
- C3-GAN 使用条件 GAN 框架,包含两个潜在码:用于类别身份的类别码 $c$ 和用于内容变化的连续码 $z$。
- 生成器将 $c$ 和 $z$ 映射为合成图像,而判别器则对图像进行嵌入,并利用类别码 $c$ 预测聚类中心。
- 通过将具有高互信息的图像-潜在码对定义为正样本对,其余所有对定义为负样本对,应用对比学习。
- 判别器被训练以最大化对比损失,使相同 $c$ 的图像特征更接近,而不同 $c$ 的图像特征更远离。
- 该方法在无标注的情况下引入场景分解,受 PerturbGAN 启发,以促使生成器专注于前景物体。
- 训练目标对潜在空间进行正则化,使其形成清晰的聚类边界,从而同时提升聚类与生成质量。
实验结果
研究问题
- RQ1能否有效结合对比学习与 InfoGAN,以在无需人工标注标签的情况下提升无监督细粒度聚类性能?
- RQ2在图像-潜在码对上使用对比损失训练判别器,是否能提升嵌入空间中的聚类分离效果?
- RQ3基于 GAN 的框架是否能在细粒度数据集上实现最先进聚类性能,同时缓解模式崩溃?
- RQ4在无边界框标注的情况下,场景分解在多大程度上改善了细粒度聚类的特征学习?
- RQ5所诱导的嵌入空间是否能同时提升聚类与图像生成质量?
主要发现
- C3-GAN 在四个细粒度数据集(CUB、Stanford Cars、Stanford Dogs 和 Oxford Flowers)上均实现了最先进聚类性能。
- 与基线 GAN 相比,该方法显著减少了模式崩溃,视觉分析显示在颜色、形状和布局方面表现出丰富的类内差异。
- 仅 C3-GAN 在无标注情况下成功实现了场景分解,而 FineGAN 和 MixNMatch 等基线方法则崩溃为仅生成背景图像。
- C3-GAN 在图像生成方面取得了具有竞争力的 FID 和 Inception Score,CUB 数据集上 Inception Score 达 8.7,Stanford Dogs 数据集上为 8.6,表明图像合成质量较高。
- 反向 KL 散度显示真实数据与生成数据的类别分布高度对齐,表明分布建模有效。
- 消融研究证实,$c$ 和 $z$ 分别有效解耦了类别身份与内容变化,其中 $c$ 控制物种,$z$ 控制姿态与背景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。