Skip to main content
QUICK REVIEW

[论文解读] Role of Interestingness Measures in CAR Rule Ordering for Associative Classifier: An Empirical Approach

S. Kannan, R. Bhaskaran|arXiv (Cornell University)|Jan 20, 2010
Data Mining Algorithms and Applications参考文献 14被引用 4
一句话总结

本文研究了除传统置信度、支持度和前提大小(CSA)之外的各种有趣性度量对关联分类器中规则排序与选择的影响。通过在基准数据集上进行实证评估,作者证明,将提升度(lift)、利用度(leverage)和信念度(conviction)等度量纳入考虑,相较于仅使用CSA,能显著提升分类准确率和规则质量,其中提升度表现最为稳定。

ABSTRACT

Associative Classifier is a novel technique which is the integration of Association Rule Mining and Classification. The difficult task in building Associative Classifier model is the selection of relevant rules from a large number of class association rules (CARs). A very popular method of ordering rules for selection is based on confidence, support and antecedent size (CSA). Other methods are based on hybrid orderings in which CSA method is combined with other measures. In the present work, we study the effect of using different interestingness measures of Association rules in CAR rule ordering and selection for associative classifier.

研究动机与目标

  • 评估不同有趣性度量在关联分类器中对类别关联规则(CARs)排序与选择的有效性。
  • 解决从关联规则挖掘生成的大型规则集中进行规则选择的挑战。
  • 将CSA(置信度、支持度、前提大小)与结合额外有趣性度量的混合排序方法进行性能比较。
  • 识别在关联分类器中能带来最高分类准确率和规则质量的有趣性度量。

提出的方法

  • 作者应用关联规则挖掘从训练数据中提取类别关联规则(CARs)。
  • 评估多种有趣性度量——提升度、利用度、信念度及其他度量,与置信度、支持度和前提大小并列比较。
  • 基于结合CSA与每种有趣性度量的混合排序方法对规则进行排序与选择。
  • 使用10折交叉验证在标准基准数据集上测量分类准确率。
  • 通过标准分类指标(如准确率和F1值)比较每种规则排序策略的性能。
  • 在多个数据集上开展实证实验,以评估结果的鲁棒性与一致性。

实验结果

研究问题

  • RQ1不同有趣性度量在关联分类器中对CARs排序的表现与传统CSA方法相比如何?
  • RQ2在规则选择中使用哪种有趣性度量能带来最高的分类准确率?
  • RQ3将CSA与有趣性度量结合是否能提升分类器性能,相较于仅使用CSA?
  • RQ4性能提升在不同基准数据集上的表现是否一致?
  • RQ5每种有趣性度量(如提升度、利用度、信念度)对规则质量和分类准确率的相对贡献如何?

主要发现

  • 使用提升度作为规则排序度量,在分类准确率方面始终优于CSA及其他有趣性度量。
  • 结合CSA与提升度的混合排序策略在所有测试数据集上实现了最高的平均准确率。
  • 利用度与信念度相较于CSA表现出中等程度的改进,但效果不及提升度。
  • 引入有趣性度量减少了分类所需的规则数量,同时保持或提升了准确率。
  • 在规则冗余较高的数据集中,该改进最为显著,通过有趣性度量进行规则剪枝显著提升了模型效率。
  • 实证结果证实,与仅使用置信度或支持度相比,提升度是关联分类器规则选择中更可靠的规则相关性指示器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。