[论文解读] Deep Continuous Clustering
Deep Continuous Clustering (DCC) 通过在鲁棒的连续目标下训练深度自编码器,联合学习非线性降维和聚类;该目标不需要预先指定簇的数量,并在高维数据集上显示出强劲的性能。
Clustering high-dimensional datasets is hard because interpoint distances become less informative in high-dimensional spaces. We present a clustering algorithm that performs nonlinear dimensionality reduction and clustering jointly. The data is embedded into a lower-dimensional space by a deep autoencoder. The autoencoder is optimized as part of the clustering process. The resulting network produces clustered data. The presented approach does not rely on prior knowledge of the number of ground-truth clusters. Joint nonlinear dimensionality reduction and clustering are formulated as optimization of a global continuous objective. We thus avoid discrete reconfigurations of the objective that characterize prior clustering algorithms. Experiments on datasets from multiple domains demonstrate that the presented algorithm outperforms state-of-the-art clustering schemes, including recent methods that use deep networks.
研究动机与目标
- 在高维空间中推动聚类,其中点之间的距离信息较弱。
- 开发一个联合嵌入与聚类的框架,优化一个单一的连续目标。
- 通过鲁棒的连续聚类形式,避免需要先验的簇数量知识。
- 通过基于梯度的求解器和深度网络实现可扩展优化。
提出的方法
- 使用由 Θ 参数化的深度自编码器将数据嵌入到一个低维空间。
- 用重建目标约束嵌入,确保 X 可以从其低维表示 Y 重构。
- 整合一个鲁棒的连续聚类目标(基于 RCC),使用一组代表 Z 和成对鲁棒损失来驱动聚类,而不需要离散重新分配。
- 定义一个联合目标 L(Ω, Z),将重建损失、数据损失和成对聚类损失结合起来,通过随机梯度方法进行优化。
- 在 X 上构造一个互相的 kNN 图,并使用非凸鲁棒 M-估计器来促进簇内凝聚和簇间分离。
- 使用堆叠去噪自编码器进行初始化,并采用连续化以简化优化,终止基于簇结构稳定性。
实验结果
研究问题
- RQ1是否可以在不预先指定簇数量的情况下,使用单一连续目标来优化联合的非线性嵌入和聚类?
- RQ2将深度降维与聚类集成是否比序列式(先嵌入再聚类)方法获得更好的聚类准确性?
- RQ3与传统聚类损失相比,鲁棒连续聚类目标在高维数据上的表现如何?
- RQ4潜在空间维度对跨数据集的聚类性能和鲁棒性的影响是什么?
主要发现
- DCC 在多个高维数据集上达到甚至优于最先进基线的聚类性能。
- 嵌入与聚类的联合优化相比于分阶段的 SDAE 嵌入后再聚类,取得更优结果。
- DCC 对潜在空间维数显示出鲁棒性,随着 d 增大超越了一些基线。
- 该方法不需要对真实簇数量的先验知识,仍在学习空间中产生清晰的簇结构。
- 卷积型和全连接自编码器配置显示出具有竞争力的运行时间,conv-DCC 的速度快于若干深度聚类替代方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。