Skip to main content
QUICK REVIEW

[论文解读] Incremental Cluster Validity Indices for Hard Partitions: Extensions and Comparative Study

Leonardo Enzo Brito da Silva, Niklas Melton|arXiv (Cornell University)|Feb 18, 2019
Advanced Clustering Algorithms Research参考文献 76被引用 5
一句话总结

本文提出了六种聚类有效性指数的增量版本——iCH、iI、iPBM、iSIL、iNI、irCIP、irH 和 iConn_Index——用于评估数据流中的在线聚类。通过使用模糊ART的对比研究表明,只有 iConn_Index 能够可靠检测出过度划分,而大多数指数则发出欠划分的信号,凸显了在流式环境中需同时监控多个 iCVI 才能实现稳健验证。

ABSTRACT

Validation is one of the most important aspects of clustering, but most approaches have been batch methods. Recently, interest has grown in providing incremental alternatives. This paper extends the incremental cluster validity index (iCVI) family to include incremental versions of Calinski-Harabasz (iCH), I index and Pakhira-Bandyopadhyay-Maulik (iI and iPBM), Silhouette (iSIL), Negentropy Increment (iNI), Representative Cross Information Potential (irCIP) and Representative Cross Entropy (irH), and Conn_Index (iConn_Index). Additionally, the effect of under- and over-partitioning on the behavior of these six iCVIs, the Partition Separation (PS) index, as well as two other recently developed iCVIs (incremental Xie-Beni (iXB) and incremental Davies-Bouldin (iDB)) was examined through a comparative study. Experimental results using fuzzy adaptive resonance theory (ART)-based clustering methods showed that while evidence of most under-partitioning cases could be inferred from the behaviors of all these iCVIs, over-partitioning was found to be a more challenging scenario indicated only by the iConn_Index. The expansion of incremental validity indices provides significant novel opportunities for assessing and interpreting the results of unsupervised learning.

研究动机与目标

  • 通过开发现有 iDB 和 iXB 之外的六个额外指数的增量版本,扩展增量聚类有效性指数(iCVI)家族。
  • 评估这些新 iCVI 在三种聚类场景下的表现:正确划分、欠划分和过度划分。
  • 使用基于模糊自适应共振理论(ART)的聚类方法,在数据流应用中对比十种 iCVI(包括 iXB 和 iDB)的性能。
  • 评估 Conn_Index 的批处理与增量实现之间的一致性,以确保其在在线监控中的可靠性。
  • 为在实时无监督学习中检测聚类质量问题,提供使用多个 iCVI 的实用指导。

提出的方法

  • 为紧凑性与分离性度量开发递归公式,以实现 Calinski-Harabasz、轮廓系数和 Conn_Index 等 CVI 的增量计算。
  • 通过递归更新质心、聚类大小和距离度量,将现有批处理 CVI(如 CH、DB、I、PBM、负熵、CIP、H)转化为增量形式。
  • 采用模糊自适应共振理论(ART)聚类并调节警惕度,生成受控的划分场景,包括正确、欠划分和过度划分情况。
  • 增量训练模糊 SMART 算法,在每次样本呈现后更新聚类原型和有效性指数,以模拟实时数据流。
  • 计算每个指数的批处理与增量版本,通过皮尔逊相关系数和均方误差(MSE)验证趋势与一致性。
  • 分析不同警惕度水平下各指数的行为,评估增量实现的敏感性与鲁棒性。

实验结果

研究问题

  • RQ1能否通过递归公式成功推导出 Calinski-Harabasz、I 指数、Pakhira-Bandyopadhyay-Maulik、轮廓系数、负熵增量、代表交叉信息势、代表交叉熵以及 Conn_Index 的增量版本?
  • RQ2当正确检测到聚类数量时,所提出的 iCVI 在增量聚类过程中的表现如何?
  • RQ3在在线聚类中,iCVI 能否检测出欠划分(聚类过少)?哪些指数在发出此问题信号方面最为有效?
  • RQ4是否有任何 iCVI 能够检测出过度划分(聚类过多)?若有,哪一个提供的信号最为可靠?
  • RQ5增量版 Conn_Index 在不同聚类粒度和数据流条件下,与批处理版本的行为有多接近?

主要发现

  • 在所评估的十个指数中,只有增量版 Conn_Index(iConn_Index)始终能提供可检测的过度划分信号,尽管其未能检测出一个特定的欠划分情况。
  • 大多数 iCVI,包括 iCH、iSIL、iI、iPBM、iNI、irCIP 和 iXB,在聚类创建时表现出明显的突变,并通过下降趋势有效发出了欠划分的信号。
  • iXB 和 irCIP 指数被发现视觉信息量最低,表现出微弱或模糊的行为模式,诊断价值有限。
  • iConn_Index 在广泛的警惕度水平下,与批处理版本保持了高度一致的趋势,皮尔逊相关系数高且均方误差低,验证了其在在线监控中的可靠性。
  • 研究证实,仅依赖单一 iCVI 是不够的;在流式环境中,必须同时监控多个指数,才能实现对聚类质量问题的稳健检测。
  • 所有八个新指数(iCH、iI、iPBM、iSIL、iNI、irCIP、irH、iConn_Index)的增量公式在稳定性与一致性方面表现良好,尤其在模糊 ART 聚类中中等至高警惕度水平下,与批处理版本高度一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。