[论文解读] Probabilistic Frequent Pattern Growth for Itemset Mining in Uncertain Databases (Technical Report)
本文提出 ProFP-Growth,这是首个基于 FP-Growth 的算法,用于在无需生成候选集的情况下,从不确定数据库中挖掘概率频繁项集。它引入了 ProFP-Tree 数据结构,并采用生成函数方法在时间复杂度为线性的情况下计算支持概率分布,相较于最先进的方法(如 ProApriori)实现了显著的性能提升。
Frequent itemset mining in uncertain transaction databases semantically and computationally differs from traditional techniques applied on standard (certain) transaction databases. Uncertain transaction databases consist of sets of existentially uncertain items. The uncertainty of items in transactions makes traditional techniques inapplicable. In this paper, we tackle the problem of finding probabilistic frequent itemsets based on possible world semantics. In this context, an itemset X is called frequent if the probability that X occurs in at least minSup transactions is above a given threshold. We make the following contributions: We propose the first probabilistic FP-Growth algorithm (ProFP-Growth) and associated probabilistic FP-Tree (ProFP-Tree), which we use to mine all probabilistic frequent itemsets in uncertain transaction databases without candidate generation. In addition, we propose an efficient technique to compute the support probability distribution of an itemset in linear time using the concept of generating functions. An extensive experimental section evaluates the our proposed techniques and shows that our ProFP-Growth approach is significantly faster than the current state-of-the-art algorithm.
研究动机与目标
- 解决不确定事务数据库中项集存在概率化情形下的频繁项集挖掘挑战。
- 克服 Apriori 类算法在不确定数据库中的局限性,如高内存占用与多次数据库扫描。
- 开发一种无需候选集的高效方法,用于识别概率频繁项集——即在至少 minSup 符合条件的事务中出现的概率高于阈值 τ 的项集。
- 通过压缩数据结构与数学优化,实现可扩展且准确的挖掘。
提出的方法
- 提出 ProFP-Tree,一种 FP-Tree 的概率变体,可在保留项集存在概率的同时,压缩不确定事务数据库。
- 引入一种新颖的基于生成函数的技术,以线性时间(相对于项的数量)计算任意项集的支持概率分布。
- 采用可能世界语义定义概率频繁项集:若某一项集在至少 minSup 符合条件的事务中出现的概率超过阈值 τ,则其为频繁项集。
- 设计 ProFP-Growth 算法,通过条件模式基与树遍历,无需生成候选集即可挖掘所有概率频繁项集。
- 使用查找表在树构建与挖掘过程中高效管理不确定项及其概率。
- 通过生成函数隐式应用泊松二项分布递推关系,避免显式枚举所有可能世界。
实验结果
研究问题
- RQ1如何在不枚举所有可能世界的情况下,高效计算不确定数据库中项集的支持概率分布?
- RQ2能否将 FP-Growth 风格的算法适配至不确定数据库中,以无需候选集的方式挖掘概率频繁项集?
- RQ3何种数据结构能有效压缩不确定数据库,同时保留频繁项集挖掘所需的必要概率信息?
- RQ4所提出的 ProFP-Growth 算法在运行时间与可扩展性方面,相较于现有基于 Apriori 的方法表现如何?
- RQ5项集出现的不确定性与确定性水平变化,对 ProFP-Tree 的大小与效率有何影响?
主要发现
- 在所有测试配置下,ProFP-Growth 的运行时间显著优于最先进的 ProApriori 算法,且随着项数与事务数的增加,性能优势进一步扩大。
- ProFP-Tree 中的节点数量在初始增长后随项数线性增长,表明由于前缀共享而实现了高效的内存利用。
- 当确定项数量(P1(x))增加时,ProFP-Tree 的大小减小,这是由于事务前缀重叠增加;当所有项均为概率存在时,其最终退化为线性链表。
- 当不确定项数量固定时,无论事务数量如何增加,不确定项查找表的大小保持不变。
- 在低 minSup 阈值下,由于概率频繁项集数量庞大,两种算法的运行时间均较高,但 ProFP-Growth 仍保持显著的性能优势。
- 随着事务数量增加,由于事务前缀重叠增加,ProFP-Tree 的大小趋于稳定,表明在高数据量下具备良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。