[论文解读] FUIM: Fuzzy Utility Itemset Mining
该论文提出FUIM,一种单阶段模糊效用项目集挖掘算法,通过新颖的模糊列表数据结构和紧致的上界模型,高效发现高模糊效用项目集(HFUIs)。结合模糊集理论与优化剪枝策略,FUIM相较于最先进的方法(如TPFU)实现高达三个数量级的性能提升,同时显著降低内存使用并具备更优的可扩展性。
Because of usefulness and comprehensibility, fuzzy data mining has been extensively studied and is an emerging topic in recent years. Compared with utility-driven itemset mining technologies, fuzzy utility mining not only takes utilities (e.g., profits) into account, but also considers quantities of items in each transaction for discovering high fuzzy utility itemsets (HFUIs). Thus, fuzziness can be regard as a key criterion to select high-utility itemsets, while the exiting algorithms are not efficient enough. In this paper, an efficient one-phase algorithm named Fuzzy-driven Utility Itemset Miner (FUIM) is proposed to find out a complete set of HFUIs effectively. In addition, a novel compact data structure named fuzzy-list keeps the key information from quantitative transaction databases. Using fuzzy-list, FUIM can discover HFUIs from transaction databases efficiently and effectively. Both completeness and correctness of the FUIM algorithm are proved by five theorems. At last, substantial experiments test three terms (runtime cost, memory consumption, and scalability) to confirm that FUIM considerably outperforms the state-of-the-art algorithms.
研究动机与目标
- 为解决现有两阶段模糊效用挖掘算法因生成过多候选项目集而导致的低效问题。
- 克服模糊效用挖掘中缺乏向下封闭性质的问题,该问题使剪枝复杂化并增加计算成本。
- 设计一种紧凑且高效的新数据结构——模糊列表,以保留定量事务数据库中的关键信息,实现高效挖掘。
- 基于模糊集理论设计一种新颖的上界模型,以缩小搜索空间并避免深度DFS遍历。
- 在运行时间、内存效率和可扩展性方面,实现对现有方法更优的完整且正确的高模糊效用项目集(HFUIs)发现。
提出的方法
- FUIM采用单阶段挖掘策略,将挖掘与数据结构构建相结合,避免了基于层次的算法中内存密集型的候选生成阶段。
- 引入模糊列表数据结构,以紧凑方式存储项目集信息,包括模糊效用和剩余效用,从而实现高效的剪枝与遍历。
- 利用模糊集理论中的最小运算计算项目集的模糊效用,通过最大运算推导出紧致的上界以实现剪枝。
- 提出一种基于剩余模糊效用的新颖上界模型,可早期剔除无希望的项目集,显著缩小搜索空间。
- 采用FUUB-升序的项目处理顺序,实证表明可减少运行时间与访问节点数,从而提升性能。
- 通过五个定理的理论证明,建立了FUIM的完整性与正确性,确保不会遗漏任何有效的HFUI。
实验结果
研究问题
- RQ1如何通过避免两阶段算法的候选生成开销,使模糊效用挖掘更加高效?
- RQ2何种数据结构可紧凑表示模糊效用信息,同时支持快速剪枝与遍历?
- RQ3基于模糊集理论的更紧致上界模型是否能显著缩小模糊效用挖掘中的搜索空间?
- RQ4项目处理顺序如何影响FUIM等模糊效用挖掘算法的性能?
- RQ5在真实与合成数据集上,FUIM在运行时间、内存消耗与可扩展性方面相较于现有算法的优越程度如何?
主要发现
- FUIM的执行速度最高可达TPFU算法的三个数量级,其中最快变体(FUIM 3)的运行时间仅为FUIM 2的三分之一。
- 在foodmart数据集上,FUIM仅使用51.84 MB内存,而TPFU需698.96 MB,展现出显著的内存效率优势。
- 在retail数据集上,γ = 0.1‰时,FUUB-升序处理相比降序处理将运行时间减少了超过300秒。
- FUIM 3(采用更紧致的上界)在运行时间与内存消耗方面均优于FUIM 2,证实了改进上界的有效性。
- 随着数据集规模从40k增至100k条事务,FUIM在运行时间与内存使用上均表现出平滑且线性的可扩展性,显示出强大的可扩展性。
- 若不采用剩余模糊效用剪枝策略,FUIM在稀疏(kosarak)与密集(mushroom)数据集上均无法在10,000秒内完成挖掘,凸显了所提剪枝机制的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。