Skip to main content
QUICK REVIEW

[论文解读] Contrastive Fine-grained Class Clustering via Generative Adversarial Networks

Yunji Kim, Jung-Woo Ha|arXiv (Cornell University)|Dec 30, 2021
Face recognition and analysis被引用 5
一句话总结

C3-GAN 提出了一种基于 GAN 的新颖方法,通过结合 InfoGAN 的类别推理与对比学习,实现无监督细粒度类别聚类,以学习有利于聚类的嵌入空间。该方法在四个细粒度数据集上实现了最先进性能,同时通过使用图像-潜在变量对作为正样本和负样本训练判别器以优化对比损失,有效缓解了模式崩溃问题。

ABSTRACT

Unsupervised fine-grained class clustering is a practical yet challenging task due to the difficulty of feature representations learning of subtle object details. We introduce C3-GAN, a method that leverages the categorical inference power of InfoGAN with contrastive learning. We aim to learn feature representations that encourage a dataset to form distinct cluster boundaries in the embedding space, while also maximizing the mutual information between the latent code and its image observation. Our approach is to train a discriminator, which is also used for inferring clusters, to optimize the contrastive loss, where image-latent pairs that maximize the mutual information are considered as positive pairs and the rest as negative pairs. Specifically, we map the input of a generator, which was sampled from the categorical distribution, to the embedding space of the discriminator and let them act as a cluster centroid. In this way, C3-GAN succeeded in learning a clustering-friendly embedding space where each cluster is distinctively separable. Experimental results show that C3-GAN achieved the state-of-the-art clustering performance on four fine-grained image datasets, while also alleviating the mode collapse phenomenon. Code is available at https://github.com/naver-ai/c3-gan.

研究动机与目标

  • 为解决无监督细粒度类别聚类的挑战,其中类别之间的细微视觉差异使得表示学习变得困难。
  • 克服现有自监督学习方法的局限性,这些方法因数据增强而将细粒度差异视为噪声。
  • 消除对人工标注边界框或分类器的依赖,使方法可应用于多样化、未经整理的数据集。
  • 通过一种对比正则化方案缓解模式崩溃,提升 GAN 训练的稳定性。
  • 学习一个解耦的、有利于聚类的嵌入空间,使得每个类别形成一个独立且线性可分的聚类。

提出的方法

  • C3-GAN 使用条件 GAN 框架,包含两个潜在码:用于类别身份的类别码 $c$ 和用于内容变化的连续码 $z$。
  • 生成器将 $c$ 和 $z$ 映射为合成图像,而判别器则对图像进行嵌入,并利用类别码 $c$ 预测聚类中心。
  • 通过将具有高互信息的图像-潜在码对定义为正样本对,其余所有对定义为负样本对,应用对比学习。
  • 判别器被训练以最大化对比损失,使相同 $c$ 的图像特征更接近,而不同 $c$ 的图像特征更远离。
  • 该方法在无标注的情况下引入场景分解,受 PerturbGAN 启发,以促使生成器专注于前景物体。
  • 训练目标对潜在空间进行正则化,使其形成清晰的聚类边界,从而同时提升聚类与生成质量。

实验结果

研究问题

  • RQ1能否有效结合对比学习与 InfoGAN,以在无需人工标注标签的情况下提升无监督细粒度聚类性能?
  • RQ2在图像-潜在码对上使用对比损失训练判别器,是否能提升嵌入空间中的聚类分离效果?
  • RQ3基于 GAN 的框架是否能在细粒度数据集上实现最先进聚类性能,同时缓解模式崩溃?
  • RQ4在无边界框标注的情况下,场景分解在多大程度上改善了细粒度聚类的特征学习?
  • RQ5所诱导的嵌入空间是否能同时提升聚类与图像生成质量?

主要发现

  • C3-GAN 在四个细粒度数据集(CUB、Stanford Cars、Stanford Dogs 和 Oxford Flowers)上均实现了最先进聚类性能。
  • 与基线 GAN 相比,该方法显著减少了模式崩溃,视觉分析显示在颜色、形状和布局方面表现出丰富的类内差异。
  • 仅 C3-GAN 在无标注情况下成功实现了场景分解,而 FineGAN 和 MixNMatch 等基线方法则崩溃为仅生成背景图像。
  • C3-GAN 在图像生成方面取得了具有竞争力的 FID 和 Inception Score,CUB 数据集上 Inception Score 达 8.7,Stanford Dogs 数据集上为 8.6,表明图像合成质量较高。
  • 反向 KL 散度显示真实数据与生成数据的类别分布高度对齐,表明分布建模有效。
  • 消融研究证实,$c$ 和 $z$ 分别有效解耦了类别身份与内容变化,其中 $c$ 控制物种,$z$ 控制姿态与背景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。