Skip to main content
QUICK REVIEW

[论文解读] Deep Image Clustering with Category-Style Representation

Junjie Zhao, Donghuan Lu|arXiv (Cornell University)|Jul 20, 2020
Domain Adaptation and Few-Shot Learning参考文献 38被引用 8
一句话总结

该论文提出DCCS,一种新颖的深度图像聚类框架,通过最大化互信息并利用数据增强,将类别(类间)特征与样式(类内)特征分离,从而学习到解耦的类别风格表征。类别部分可直接用作聚类分配,在五个公开数据集上显著优于当前最先进方法,准确率和标准化互信息均有显著提升。

ABSTRACT

Deep clustering which adopts deep neural networks to obtain optimal representations for clustering has been widely studied recently. In this paper, we propose a novel deep image clustering framework to learn a category-style latent representation in which the category information is disentangled from image style and can be directly used as the cluster assignment. To achieve this goal, mutual information maximization is applied to embed relevant information in the latent representation. Moreover, augmentation-invariant loss is employed to disentangle the representation into category part and style part. Last but not least, a prior distribution is imposed on the latent representation to ensure the elements of the category vector can be used as the probabilities over clusters. Comprehensive experiments demonstrate that the proposed approach outperforms state-of-the-art methods significantly on five public datasets.

研究动机与目标

  • 解决现有深度聚类方法依赖重建或生成损失而引入无关信息并使训练复杂化的问题。
  • 实现端到端学习潜在表征,使类别成分可直接用作聚类分配,无需额外聚类步骤。
  • 利用数据增强作为监督信号,将判别性类别信息与非必要的样式变化解耦。
  • 通过施加先验分布,确保类别表征适合聚类,鼓励其呈现类似独热向量的行为。
  • 通过全面的实验与消融研究,证明方法在性能上显著优于当前最先进方法。

提出的方法

  • 通过最大化输入图像与其潜在表征之间的互信息,保留判别性信息并防止任意表征的出现。
  • 利用数据增强在潜在空间中诱导不变性,从而实现类别(类间)与样式(类内)成分的解耦。
  • 将潜在表征分解为两部分:$Z_c$(类别)和 $Z_s$(样式),其中 $Z_c$ 直接用于聚类分配。
  • 对 $Z_c$ 施加先验分布,以鼓励其取值接近独热向量,使其适合作为聚类的概率分布。
  • 端到端训练网络,采用三种损失:互信息最大化、基于增强的类别-样式解耦,以及先验分布正则化。
  • 使用基于判别器的对抗性损失,增强潜在表征的判别能力,而无需解码器或生成器。

实验结果

研究问题

  • RQ1仅通过互信息最大化是否足以替代重建或生成损失,以在深度聚类中保留判别性特征?
  • RQ2数据增强是否能在深度聚类框架中有效解耦类别与样式表征?
  • RQ3对类别表征施加先验分布是否能实现无需额外聚类步骤的潜在向量直接作为聚类分配?
  • RQ4所提方法的各个组件对整体聚类性能的贡献如何?
  • RQ5所提方法是否能在具有不同类内变化水平的多样化图像数据集上实现SOTA性能?

主要发现

  • 所提出的DCCS框架在五个公开数据集上达到SOTA性能,Fashion-MNIST的平均准确率为0.756,CIFAR-10为0.656,显著优于先前方法。
  • 在 $Z_c$ 上应用K-means得到的性能几乎与在完整表征 $Z$ 上应用K-means完全相同,证实 $Z_c$ 包含足够的判别性信息用于聚类。
  • 在 $Z_s$ 上应用K-means的性能显著更差(例如Fashion-MNIST上ACC为0.498),证明样式信息与类别信息实现了有效解耦。
  • 消融研究显示,结合互信息损失、基于增强的解耦损失以及先验分布正则化三者可获得最佳性能,CIFAR-10上准确率提升高达10%。
  • 增强损失的最优权重 ($\beta_{\text{Aug}}$) 依赖于数据集,过小或过大的值均导致性能下降,表明解耦与聚类紧凑性之间存在权衡。
  • 样式表征 $Z_s$ 的维度对性能影响极小,但完全移除 $Z_s$ 会导致准确率显著下降,证明其在捕捉类内变化中的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。