[论文解读] Adjusted Concordance Index, an extension of the Adjusted Rand index to fuzzy partitions
本文提出了调整一致性指数(ACI),这是针对模糊划分的调整兰德指数(Adjusted Rand Index)的扩展,通过使用归一化一致性度量(NDC)校正偶然一致性。通过基于置换估计的期望随机性对NDC进行调整,ACI为模糊聚类提供了更可靠的外部验证度量,相较于现有方法在一致性和可解释性方面表现更优,尤其在成员概率接近0.5或比较模糊与硬划分时表现更佳。
In comparing clustering partitions, Rand index (RI) and Adjusted Rand index (ARI) are commonly used for measuring the agreement between the partitions. Both these external validation indexes aim to analyze how close is a cluster to a reference (or to prior knowledge about the data) by counting corrected classified pairs of elements. When the aim is to evaluate the solution of a fuzzy clustering algorithm, the computation of these measures require converting the soft partitions into hard ones. It is known that different fuzzy partitions describing very different structures in the data can lead to the same crisp partition and consequently to the same values of these measures. We compare the existing approaches to evaluate the external validation criteria in fuzzy clustering and we propose an extension of the ARI for fuzzy partitions based on the normalized degree of concordance. Through use of real and simulated data, we analyze and evaluate the performance of our proposal.
研究动机与目标
- 为解决现有外部验证指数(如兰德指数和调整兰德指数)在应用于模糊划分时的局限性,这些方法需要对软成员资格进行硬化,可能导致误导性结果。
- 提出一种新指数,保留模糊划分的原始结构,无需转换为硬划分,从而实现对聚类解更准确的评估。
- 开发一种考虑相似性比较中随机性的度量,提升模糊聚类外部验证中的一致性和可解释性。
- 在真实和模拟数据上评估所提出的调整一致性指数(ACI)相较于现有兰德指数扩展版本的性能。
- 证明ACI在概率划分和鲁斯皮尼划分下保持了反射性等理想性质。
提出的方法
- 本文将Huberleier等人(2012)提出的归一化一致性度量(NDC)扩展为调整版本,即调整一致性指数(ACI),以校正偶然一致性。
- ACI通过计算观察到的NDC与其在相似性矩阵随机置换下的期望值之间的差值,再对该差值进行归一化得到。
- 通过使用大量相似性矩阵的随机置换进行蒙特卡洛模拟,估计期望NDC。
- 该方法通过直接在成员资格矩阵上操作,避免转换为硬划分,从而保留原始模糊结构。
- ACI被设计为具有反射性(当将一个划分与自身比较时结果为1),且在随机性下具有明确定义的期望值。
- 该方法使用真实数据集(Iris、Sonar、Vehicle、Ionosphere、Flags)和模拟数据进行验证,与NDC及其他基于兰德指数的扩展版本进行比较。
实验结果
研究问题
- RQ1如何在不需对成员资格度量进行硬化的情况下,有意义地将调整兰德指数扩展至模糊划分?
- RQ2所提出的调整一致性指数(ACI)在模糊聚类评估中是否表现出优于现有兰德指数扩展版本的一致性和可解释性?
- RQ3ACI能否有效校正成员资格概率接近0.5时模糊划分中的偶然一致性,从而避免类似随机行为的误判?
- RQ4在真实和模拟数据集上评估模糊聚类解时,ACI相较于NDC及其他基于兰德指数的指标表现如何?
- RQ5在何种条件下,ACI能保持反射性和度量行为等理想性质,用于模糊划分比较?
主要发现
- ACI在一致性和可解释性方面始终优于NDC及其他基于兰德指数的扩展版本,尤其在成员概率接近0.5时,此时NDC可能产生误导性高的结果。
- 在Sonar数据集中,ACI在比较估计划分与真实划分时得到-0.0001的值,表明接近偶然一致性,这与两个划分的成员概率均接近0.5的事实一致。
- 在Iris数据集中,ACI在比较估计划分与真实划分时得到0.9298的值,表明一致性较强,而NDC为0.9780,证实高NDC值并不总意味着有意义的一致性。
- ACI表现出反射性:当将一个划分与自身比较时,ACI在所有数据集中均正确返回1.0000,而其他扩展版本则未能满足此性质。
- ACI的值比其他指标(如Anderson等人、Brouwer、Campello)更一致,后者有时在将划分与自身比较时返回的值反而低于与真实划分比较时的值。
- 通过PD聚类算法,作者生成了概率参考划分,表明ACI能有效验证与真实结构高度一致的模糊聚类解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。