[论文解读] Scalable Deep Unsupervised Clustering with Concrete GMVAEs
本文提出 Concrete GMVAE,一种可扩展的深度无监督聚类方法,通过使用 Concrete(Gumbel-Softmax)分布对高斯混合 VAE 中的离散聚类分配进行连续松弛,替代原有离散分配。通过利用重参数化技巧实现可微采样,训练时间复杂度从与聚类数量成线性关系降低至常数,使在 20 个聚类的 CIFAR-100 上训练速度提升 75-80%,同时保持相近的聚类性能。
Discrete random variables are natural components of probabilistic clustering models. A number of VAE variants with discrete latent variables have been developed. Training such methods requires marginalizing over the discrete latent variables, causing training time complexity to be linear in the number clusters. By applying a continuous relaxation to the discrete variables in these methods we can achieve a reduction in the training time complexity to be constant in the number of clusters used. We demonstrate that in practice for one such method, the Gaussian Mixture VAE, the use of a continuous relaxation has no negative effect on the quality of the clustering but provides a substantial reduction in training time, reducing training time on CIFAR-100 with 20 clusters from 47 hours to less than 6 hours.
研究动机与目标
- 解决标准 GMVAE 的高训练时间复杂度问题,其复杂度因对离散聚类分配进行边缘化而随聚类数量线性增长。
- 实现具有大量聚类的深度聚类模型的端到端训练,而当前由于计算成本过高而难以实现。
- 在大幅降低训练时间的同时保持聚类性能,通过离散潜在变量的连续松弛实现。
- 证明对聚类分配变量进行连续松弛不会在对数似然或聚类能力方面降低模型质量。
提出的方法
- 用连续的 Concrete 分布替代 GMVAE 中的离散类别分布 $ q(\mathbf{y} \mid \mathbf{x}) $,以实现可微采样。
- 对 Concrete 分布应用重参数化技巧,使梯度可通过聚类分配反向传播,而无需对所有聚类索引求和。
- 使用单样本蒙特卡洛估计的 ELBO,不再需要对 $ \mathbf{y} $ 求和,将训练时间复杂度从 $ O(K) $ 降低至 $ O(1) $,其中 $ K $ 为聚类数量。
- 为 KL 散度项 $ D_{KL}(q(\mathbf{y} \mid \mathbf{x}) \parallel p(\mathbf{y})) $ 引入温度退火调度,从零开始逐渐增加至一,以防止后验坍缩并促进有意义的聚类使用。
- 采用祖先采样从松弛后的后验分布生成 $ \mathbf{y} $ 和 $ \mathbf{z} $,实现高效且可微的训练。
- 在推理阶段,通过将 $ q(\mathbf{y} \mid \mathbf{x}) $ 的 argmax 进行 one-hot 编码,将 $ \mathbf{y} $ 离散化,恢复离散聚类分配用于推理。
实验结果
研究问题
- RQ1在 GMVAE 中对离散聚类分配进行连续松弛是否能降低训练时间复杂度而不损害聚类性能?
- RQ2Concrete 分布是否能有效支持在深度聚类模型中对离散潜在变量进行反向传播?
- RQ3与标准 GMVAE 相比,Concrete GMVAE 的训练时间如何随聚类数量增加而变化?
- RQ4KL 退火对模型学习有意义聚类分配能力有何影响?
- RQ5Concrete GMVAE 是否能在显著更快的速度下实现与标准 GMVAE 相当的对数似然和聚类质量?
主要发现
- 在 20 个聚类的 CIFAR-100 上,Concrete GMVAE 的训练时间减少了 75%,从每轮 47.24 小时降至 5.73 小时。
- 在 MNIST 上使用 10 个聚类时,训练时间从 15.73 小时减少至 3.55 小时,提速 77%。
- 在 MNIST 上,测试集对数似然值在标准 GMVAE 与 Concrete GMVAE 之间几乎相同:分别为 -46.96 ± 0.81 和 -46.61 ± 0.79;在 CIFAR-100 上分别为 -1725.87 ± 2.12 和 -1725.47 ± 2.20。
- 若无 KL 退火,模型无法学习聚类分配,因为 KL 散度坍缩至零,证实了退火调度的必要性。
- 训练时间复杂度在聚类数量上实际为常数,使模型可扩展至以往标准 GMVAE 难以处理的大规模聚类问题。
- 该方法在保持模型质量的同时,实现了对具有大量聚类的深度聚类模型的高效端到端训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。