[论文解读] Utility-driven Mining of Contiguous Sequences
本文提出 FUCPM,一种新颖的算法,用于在复杂、多物品序列数据库中进行基于效用的连续序列模式(UCSPM)挖掘。通过利用紧凑的数据结构——序列信息列表和实例链,以及基于序列加权和物品扩展效用界值的两种剪枝策略(GUIP 和 LUIP),FUCPM 在运行时间与内存使用方面显著优于现有最先进方法,同时仅聚焦于连续模式,从而产生更简洁的结果,展现出卓越的效率与可扩展性。
Recently, contiguous sequential pattern mining (CSPM) gained interest as a research topic, due to its varied potential real-world applications, such as web log and biological sequence analysis. To date, studies on the CSPM problem remain in preliminary stages. Existing CSPM algorithms lack the efficiency to satisfy users' needs and can still be improved in terms of runtime and memory consumption. In addition, existing algorithms were developed to deal with simple sequence data, working with only one event at a time. Complex sequence data, which represent multiple events occurring simultaneously, are also commonly observed in real life. In this paper, we propose a novel algorithm, fast utility-driven contiguous sequential pattern mining (FUCPM), to address the CSPM problem. FUCPM adopts a compact sequence information list and instance chain structures to store the necessary information of the database and candidate patterns. For further efficiency, we develop the global unpromising items pruning and local unpromising items pruning strategies, based on sequence-weighted utilization and item-extension utilization, to reduce the search space. Extensive experiments on real-world and synthetic datasets demonstrate that FUCPM outperforms the state-of-the-art algorithms and is scalable enough to handle complex sequence data.
研究动机与目标
- 为解决现有连续序列模式挖掘(CSPM)算法在运行时间与内存消耗方面过高的局限性,以及缺乏对复杂、多物品序列的支持。
- 克服传统序列模式挖掘(SPM)与高效益序列模式挖掘(HUSPM)的不足,后者仅依赖频率或效益,未强制要求连续性,导致生成的模式可解释性或现实性较差。
- 开发一种高效、可扩展的算法,仅发现连续的高效益序列模式(HUCSPs),确保模式能真实反映轨迹或DNA序列等数据中的连续性特征。
- 通过基于上界效益估计的新型剪枝策略提升挖掘效率,减少搜索空间,同时不损失完备性。
提出的方法
- FUCPM 采用序列信息列表与实例链数据结构,紧凑地存储并高效计算候选模式的效益与上界值。
- 提出序列加权效益(SWU)以估计序列前缀的最大可能效益,实现对无希望候选的全局剪枝。
- 提出物品扩展效益(IEU)作为更紧致的上界,用于局部剪枝,提升模式扩展过程中的搜索空间缩减效果。
- 全局无希望物品剪枝(GUIP)策略利用 SWU 早期剔除无希望的物品,而局部无希望物品剪枝(LUIP)策略在模式扩展过程中应用 IEU,进一步缩小搜索空间。
- 通过将每个项集视为一组同时发生的事件,FUCPM 处理由多物品组成的序列,支持车辆轨迹或生物序列等复杂现实数据。
- FUCPM 设计具备可扩展性,其运行时间与内存消耗随数据集规模线性增长,即使在提高效益阈值时亦保持稳定。
实验结果
研究问题
- RQ1基于效用的连续序列模式挖掘算法能否在运行时间与内存效率方面优于现有最先进 CSPM 与 HUSPM 方法?
- RQ2所提出的 GUIP 与 LUIP 剪枝策略在减少连续高效益序列模式搜索空间方面的有效性如何?
- RQ3FUCPM 在真实与合成多物品序列数据中,随着数据集规模与复杂度的增加,其可扩展性如何?
- RQ4与包含非连续模式的一般 HUSPM 算法相比,FUCPM 输出结果的简洁性如何?
主要发现
- 在全部六个真实数据集上,FUCPM 均优于最先进算法 ProUM,所有案例均于 2 秒内完成挖掘;而 ProUM 在三个数据集(BMS、Kosarak10k、FIFA)上未能于 2 小时内完成。
- 在《圣经》数据集上,与 ProUM 相比,FUCPM 将内存使用减少 69%(417.35 MB vs. 1352.71 MB),运行时间减少 93%(2.12s vs. 29.20s)。
- 消融研究证实,GUIP 与 LUIP 均有助于剪枝,其中 LUIP 在缩小搜索空间方面表现更优。
- FUCPM 展现出线性可扩展性:从 10K 到 400K 条序列,运行时间与内存使用几乎随数据集规模线性增长,表明其具备强大的可扩展性。
- 发现的 HUCSP 数量显著低于一般 HUSPM 算法发现的 HUSP 数量(例如,《圣经》数据集中为 36 个 vs. 2,760 个),证实了连续性约束带来的结果简洁性。
- 在合成数据集上,由于基于总效益的自适应阈值机制,FUCPM 保持了稳定性能,候选集与 HUCSP 数量随数据集规模增长而几乎无增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。