[论文解读] Deep Clustering Using the Soft Silhouette Score: Towards Compact and Well-Separated Clusters
本文提出 DCSS,一种使用可微分软轮廓系数来优化紧凑且分离良好的聚类的深度聚类方法。通过将轮廓系数概率化并整合到基于自编码器的框架中,该方法在基准数据集上实现了最先进性能,相较于现有方法在 NMI 上提升 0.03–0.07,在 ARI 上提升 0.03–0.06。
Unsupervised learning has gained prominence in the big data era, offering a means to extract valuable insights from unlabeled datasets. Deep clustering has emerged as an important unsupervised category, aiming to exploit the non-linear mapping capabilities of neural networks in order to enhance clustering performance. The majority of deep clustering literature focuses on minimizing the inner-cluster variability in some embedded space while keeping the learned representation consistent with the original high-dimensional dataset. In this work, we propose soft silhoutte, a probabilistic formulation of the silhouette coefficient. Soft silhouette rewards compact and distinctly separated clustering solutions like the conventional silhouette coefficient. When optimized within a deep clustering framework, soft silhouette guides the learned representations towards forming compact and well-separated clusters. In addition, we introduce an autoencoder-based deep learning architecture that is suitable for optimizing the soft silhouette objective function. The proposed deep clustering method has been tested and compared with several well-studied deep clustering methods on various benchmark datasets, yielding very satisfactory clustering results.
研究动机与目标
- 解决现有深度聚类方法仅关注最小化类内方差、忽略类间分离性的局限性。
- 开发轮廓系数的可微分、概率化公式,支持在深度聚类中进行端到端训练。
- 引导学习到的表征形成既紧凑又明显分离的聚类。
- 在标准基准数据集上,将所提方法与已建立的深度聚类基线进行对比评估。
- 证明同时优化紧凑性和分离性可带来更优的聚类性能。
提出的方法
- 提出一种软轮廓系数,作为传统轮廓系数的可微分、概率化扩展,支持基于梯度的优化。
- 将软轮廓目标集成到基于自编码器的深度聚类框架中,结合重建损失与聚类损失。
- 使用径向基函数(RBF)层建模软聚类分配,聚类中心通过在预训练自编码器嵌入上使用 k-means 初始化。
- 采用混合损失函数,结合自编码器重建误差与基于软轮廓的聚类损失,通过超参数 λ₁ 和 λ₂ 进行平衡。
- 采用标准深度学习训练协议:使用 Adam 优化器,训练 100 个周期,批量大小为 256,并应用 L2 正则化以增强稳定性。
- 对聚类方差 σ 采用固定初始化,并通过小而相等的超参数(λ₁ = λ₂ = 0.01)平衡两项损失成分。
实验结果
研究问题
- RQ1可微分、概率化的轮廓系数公式是否能通过同时优化紧凑性和分离性,提升深度聚类性能?
- RQ2在基于自编码器的框架中,软轮廓系数是否相比传统聚类目标(如 k-means 或 KL 散度)能带来更优的聚类质量?
- RQ3在多样化的基准数据集上,所提出的 DCSS 方法在 NMI 和 ARI 指标上与最先进深度聚类方法相比表现如何?
- RQ4软轮廓目标是否能有效引导学习到的潜在表征形成更清晰、更分离的聚类?
- RQ5结合重建损失与软轮廓损失对聚类性能和表征质量有何影响?
主要发现
- DCSS 方法在 NMI 上取得显著提升,相较于现有方法,在所有基准数据集上提升幅度为 0.03 至 0.07。
- ARI 指标也表现出一致的改进,提升范围在 0.03 至 0.06 之间,表明聚类质量与分离性更优。
- 该方法在所有测试数据集上均优于已建立的基线方法(如 DEC、DCN 和 IDEC),包括 HAR 和 WVF-v1 等以往方法表现欠佳的数据集。
- 可视化结果表明,聚类分配概率更高的图像更具代表性,证实了模型学习有意义聚类结构的能力。
- 软轮廓目标成功引导网络学习到既紧凑又分离良好的表征,符合设计初衷。
- 损失组件消融实验与超参数调优结果证实,平衡重建损失与软轮廓损失对实现最佳性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。