Skip to main content
QUICK REVIEW

[论文解读] Combining Clustering techniques and Formal Concept Analysis to characterize Interestingness Measures

Dhouha Grissa, Sylvie Guillaume|arXiv (Cornell University)|Aug 21, 2010
Rough Sets and Fuzzy Logic参考文献 22被引用 5
一句话总结

本文提出一种基于形式概念分析(FCA)的框架,用于验证和优化由层次聚类(AHC)和划分聚类(k-means)生成的兴趣度度量(IMs)的聚类结果。通过将61个IMs与19个语义属性建模为形式背景,FCA揭示了稳定且语义一致的分组,验证了AHC/k-means的结果,并识别出可疑或零散的聚类,为知识发现中的IM选择提供了一种系统化方法。

ABSTRACT

Formal Concept Analysis "FCA" is a data analysis method which enables to discover hidden knowledge existing in data. A kind of hidden knowledge extracted from data is association rules. Different quality measures were reported in the literature to extract only relevant association rules. Given a dataset, the choice of a good quality measure remains a challenging task for a user. Given a quality measures evaluation matrix according to semantic properties, this paper describes how FCA can highlight quality measures with similar behavior in order to help the user during his choice. The aim of this article is the discovery of Interestingness Measures "IM" clusters, able to validate those found due to the hierarchical and partitioning clustering methods "AHC" and "k-means". Then, based on the theoretical study of sixty one interestingness measures according to nineteen properties, proposed in a recent study, "FCA" describes several groups of measures.

研究动机与目标

  • 解决在关联规则挖掘中从大量可用选项中选择合适兴趣度度量(IMs)的挑战。
  • 采用形式化、理论驱动的方法,验证传统聚类方法(AHC和k-means)在IMs上应用的结果。
  • 基于19个语义标准,识别具有相似行为特性的稳定且语义一致的IMs分组。
  • 为研究人员和实践者提供一种可靠的方法,以评估和选择高质量IMs,从而实现有效的知识发现。

提出的方法

  • 从61个IMs(对象)与19个语义属性(属性)构成的61×19矩阵构建形式背景,其中单元格表示某个IM是否满足某一属性。
  • 应用形式概念分析(FCA)生成概念格,揭示基于共享属性的IMs之间的概念关系与分层分组。
  • 通过格的可视化验证或质疑AHC和k-means识别出的聚类,特别评估聚类的凝聚性与边界模糊性。
  • 选取关键概念节点(如C9、C5、C2)分析其成员组成与IMs的接近程度,识别稳定与可疑的聚类。
  • 通过检查聚类中所有成员是否具有相同的意图(即属性集合)来评估聚类的稳定性,并评估外部度量与聚类的接近程度。
  • 通过分析IMs在格中相对于多个聚类的位置,识别出在聚类分配上存在模糊性的度量(如召回率、信息增益),从而揭示其重叠或不稳定归属。

实验结果

研究问题

  • RQ1FCA能否有效验证AHC和k-means聚类生成的兴趣度度量聚类?
  • RQ2哪些兴趣度度量聚类在共享属性基础上表现出强语义凝聚性?
  • RQ3为何某些聚类(如C2、C5)难以通过FCA验证,这对其结构稳定性有何含义?
  • RQ4FCA如何揭示特定兴趣度度量在多个聚类间存在模糊或重叠归属的情况?
  • RQ5FCA在多大程度上可作为IM分析中聚类结果的第三方验证机制?

主要发现

  • FCA成功验证了C1和C4聚类,因为这两个聚类的所有成员均共享同一意图,并在格中形成语义一致的群体。
  • C9聚类得到FCA的充分验证,其所有成员均构成一个稳定的概念,且在格中紧密相连,证实了其行为的一致性。
  • C2聚类存在疑问,因其属性共享不一致且成员归属模糊;FCA显示其成员缺乏完全的语义一致性,且与其它聚类距离较近。
  • C5聚类在格中呈现碎片化,分裂为两组:{负可靠性, 因果置信度, 因果确认置信度} 和 {特异性, 提升度, 潜在因果依赖性},表明其凝聚性差。
  • 如召回率、信息增益和基尼系数等度量靠近多个聚类(如C4、C5、C8、C9),表明其聚类归属模糊或不稳定,其接近性暗示共享属性但无明确归属。
  • 福田度量与C6聚类(IIE、IIER、IP3E)紧密关联,证实其归属正确;而互信息和福田度量等则靠近多个聚类,凸显其定位模糊。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。