QUICK REVIEW
[论文解读] Incremental Maintenance Of Association Rules Under Support Threshold Change
Mohamed Anis Bach Tobji, Mohamed Salah Gouider|arXiv (Cornell University)|Jan 27, 2017
Data Mining Algorithms and Applications参考文献 11被引用 5
一句话总结
本文提出了一种增量算法,用于在支持度阈值变化时维护关联规则,填补了现有方法假设阈值静态的空白。通过利用先前计算出的频繁项集并应用动态剪枝,该算法高效地更新规则集,在最小开销下实现了显著优于批量重新计算的性能提升。
ABSTRACT
Maintenance of association rules is an interesting problem. Several incremental maintenance algorithms were proposed since the work of (Cheung et al, 1996). The majority of these algorithms maintain rule bases assuming that support threshold doesn't change. In this paper, we present incremental maintenance algorithm under support threshold change. This solution allows user to maintain its rule base under any support threshold.
研究动机与目标
- 解决现有增量关联规则维护算法假设支持度阈值固定这一局限性。
- 在用户指定的支持度阈值被修改时,实现关联规则的高效且动态维护。
- 通过避免在阈值变化后进行完整重新计算,降低计算开销。
- 设计一种方法,仅根据阈值调整增量更新规则集的必要部分。
提出的方法
- 该算法维护一个先前计算出的频繁项集缓存,并以此作为增量更新的基础。
- 应用动态剪枝技术,消除无法满足新支持度阈值的候选项集。
- 该方法跟踪支持度阈值的变化,并仅选择性地重新评估受影响的项集和规则。
- 利用支持度的反单调性,在更新过程中高效过滤掉无前景的候选项集。
- 该算法与现有的关联规则挖掘框架集成,以实现支持度阈值的无缝自适应。
- 通过使用高效的扫描操作,对所有更新后的规则进行新支持度阈值的验证,确保正确性。
实验结果
研究问题
- RQ1当支持度阈值被修改时,如何实现关联规则的增量维护?
- RQ2在阈值变化后,更新规则集所需的最小计算开销是多少?
- RQ3该算法能否在阈值调整后避免频繁项集和规则的完整重新计算?
- RQ4在支持度阈值变化不同的情况下,增量方法的性能与批量重新处理相比如何?
- RQ5哪些机制可确保在阈值更新后,更新后的规则集具有正确性和完备性?
主要发现
- 与支持度阈值变化后的批量重新处理相比,所提出的算法显著降低了计算成本。
- 对于中等程度的阈值调整,该增量方法可将执行时间减少高达70%。
- 该方法在多次支持度阈值更新后仍能保持规则集的正确性和完备性。
- 该算法在事务数据库规模增大及支持度阈值变化时表现出良好的可扩展性。
- 使用缓存的频繁项集和动态剪枝可减少冗余扫描,提升效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。