[论文解读] MiCE: Mixture of Contrastive Experts for Unsupervised Image Clustering
MiCE 提出了一种统一的概率聚类框架,将对比学习与专家混合模型相结合,以联合优化判别性表征和聚类结构。通过使用门控网络将样本路由至专门的对比学习专家,并采用可扩展的 EM 算法进行训练,MiCE 在四个自然图像基准上实现了最先进性能,且无需预训练,在 CIFAR-10 上相比强基线方法 SCAN 和 MoCo 最高提升达 90.3%。
We present Mixture of Contrastive Experts (MiCE), a unified probabilistic clustering framework that simultaneously exploits the discriminative representations learned by contrastive learning and the semantic structures captured by a latent mixture model. Motivated by the mixture of experts, MiCE employs a gating function to partition an unlabeled dataset into subsets according to the latent semantics and multiple experts to discriminate distinct subsets of instances assigned to them in a contrastive learning manner. To solve the nontrivial inference and learning problems caused by the latent variables, we further develop a scalable variant of the Expectation-Maximization (EM) algorithm for MiCE and provide proof of the convergence. Empirically, we evaluate the clustering performance of MiCE on four widely adopted natural image datasets. MiCE achieves significantly better results than various previous methods and a strong contrastive learning baseline.
研究动机与目标
- 解决两阶段聚类方法将表征学习与聚类分离所带来的局限性,该分离可能导致次优解。
- 将通过对比学习实现的判别性表征学习与使用隐式混合模型的概率聚类统一起来。
- 开发一种基于 EM 的可扩展训练算法,联合优化表征与聚类分配,无需辅助正则化。
- 证明所提出方法在性能上优于端到端聚类基线方法以及强大的两阶段对比学习预训练方法。
- 从理论上证明 ELBO 目标函数有界,且 EM 算法收敛,从而确保训练过程的稳定性。
提出的方法
- 构建一个条件模型混合体,其中每个专家通过对比学习学习区分实例子集。
- 引入门控函数,基于潜在语义结构为每个实例分配特定专家的权重。
- 采用概率框架并引入隐式聚类变量来建模专家混合,从而实现表征与聚类分配的联合优化。
- 设计一种可扩展的 EM 算法:E 步骤对隐式聚类变量执行近似后验推断;M 步骤针对所有模型参数最大化 ELBO。
- 为每个专家引入对比损失以提升判别能力,同时在全网络中共享原型以保证一致性。
- 通过优化单一 ELBO 目标函数避免正则化,确保端到端训练过程中无需辅助损失。
实验结果
研究问题
- RQ1能否通过将对比学习与混合建模相结合的统一框架,在无监督图像聚类上超越两阶段基线方法?
- RQ2所提出的对比专家混合模型(MiCE)是否能在无需预训练的情况下实现优于当前最先进方法的聚类性能?
- RQ3与两阶段方法(如先用 SimCLR 预训练,再聚类)相比,MiCE 在性能与收敛性方面表现如何?
- RQ4MiCE 的基于 EM 的训练过程在理论上是否可靠,ELBO 目标函数是否保证收敛?
- RQ5MiCE 是否能跨数据集泛化,且无需预先知晓真实聚类数 K?其在过聚类情况下的处理能力如何?
主要发现
- MiCE 仅使用较弱的数据增强策略(MoCo/InstDisc)在 CIFAR-10 上达到 83.4% 的聚类准确率,优于两阶段设置下使用 SimCLR(78.7%)和 RandAugment(81.8%)的 SCAN 方法。
- 在预训练条件下,MiCE 使用 SimCLR 增强策略在 CIFAR-10 上达到 90.3% 的准确率,即使 SCAN 使用自标签化策略,其最佳结果(87.6%)仍被超越。
- 通过预训练与微调,MiCE 在 CIFAR-10 上达到 89.3% 的准确率,表明其在相同预训练协议下仍优于 SCAN,展现出鲁棒性与性能优势。
- ELBO 目标函数有界,且所提出的 EM 算法收敛,为训练过程提供了理论基础。
- 两组原型(门控与专家)之间并未被鼓励趋于相似,实证余弦相似度低于 0.25,表明其角色明确区分,且非对应关系未造成负面影响。
- MiCE 无需额外正则化或损失权重的超参数调优,因其优化的是单一统一的目标函数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。