[论文解读] An Algorithm for Mining High Utility Closed Itemsets and Generators
本文提出 HUCI-Miner,一种新颖的算法,用于同时挖掘高单位置闭项集(HUCI)及其最小生成元,从而在高单位置项集挖掘中实现压缩且无冗余的关联规则生成。通过将传统支持-置信度挖掘中的最小生成元概念扩展至基于单位置的挖掘,该方法在保留规则语义的同时显著压缩了高单位置项集。
Traditional association rule mining based on the support-confidence framework provides the objective measure of the rules that are of interest to users. However, it does not reflect the utility of the rules. To extract non-redundant association rules in support-confidence framework frequent closed itemsets and their generators play an important role. To extract non-redundant association rules among high utility itemsets, high utility closed itemsets (HUCI) and their generators should be extracted in order to apply traditional support-confidence framework. However, no efficient method exists at present for mining HUCIs with their generators. This paper addresses this issue. A post-processing algorithm, called the HUCI-Miner, is proposed to mine HUCIs with their generators. The proposed algorithm is implemented using both synthetic and real datasets.
研究动机与目标
- 为解决缺乏高效挖掘高单位置闭项集(HUCI)及其生成元的方法的问题。
- 通过整合最小生成元概念,实现在高单位置项集挖掘中压缩且无冗余的关联规则挖掘。
- 在保留语义和统计相关性的同时,减小高单位置项集及其关联规则集的大小。
- 提供一个后处理框架,支持在高单位置模式上生成传统支持-置信度规则。
- 在具有不同单位置阈值的合成与真实世界数据集上,展示 HUCI-Miner 的有效性。
提出的方法
- 提出一种基于层次的搜索算法 HUCI-Miner,通过单次遍历同时挖掘高单位置项集(HUI)、高单位置闭项集(HUCI)及其最小生成元(HG)。
- 使用单位置单元数组从 HUCIs 重建所有 HUIs,实现无需完整数据库扫描的高效规则生成。
- 在高单位置挖掘中引入最小生成元的概念,其中生成元是能唯一生成一个闭项集的最小项集。
- 采用基于闭包的方法,通过检查一个项集是否与所有超集具有相同单位置来识别 HUCIs。
- 实施后处理步骤,通过子集单位置比较验证最小性,从 HUCIs 中提取生成元。
- 采用主内存存储高单位置项集,以加速处理并提升性能。
实验结果
研究问题
- RQ1如何在一个统一的算法框架中高效挖掘高单位置闭项集(HUCI)及其最小生成元?
- RQ2与完整枚举相比,HUCI-Miner 在多大程度上压缩了高单位置项集的数量?
- RQ3将最小生成元整合到高单位置挖掘中,能否有效减少提取的关联规则中的冗余?
- RQ4HUCI-Miner 在具有不同单位置阈值的多样化真实与合成数据集上的性能如何扩展?
- RQ5不同最小单位置阈值对发现的 HUCI 和生成元数量有何影响?
主要发现
- HUCI-Miner 通过将项集压缩为 HUCIs 及其生成元,实现了高达 80% 的高单位置项集数量减少。
- 在 T10I4D100K 数据集上,当最小单位置为 0.006% 时,HUCI-Miner 将 HUI 数量从 192,673 减少至 111,544 个 HUCIs 和 28,837 个生成元,总计压缩为 140,381 个模式。
- 在密集的 Chess 数据集上,当最小单位置为 25% 时,HUCI-Miner 将 HUI 数量从 13,331 减少至 8,700 个 HUCIs 和 3,811 个生成元,实现 34.5% 的减少。
- 在 Retail 数据集中,所有 HUI 均为闭项集(100% 闭包率),在最小单位置为 0.02% 时仅发现 2 个生成元,表明压缩效率极高。
- Chain-store 数据集在所有阈值下均达到 100% 闭包率,且未发现非自生成元,表明所有 HUCIs 均为极大项集。
- 该算法在大型数据集(如 Chain-store,110 万条事务)上表现出可扩展性,HUCI 和 HG 数量随最小单位置阈值的增加而可预测地增长。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。