Skip to main content
QUICK REVIEW

[论文解读] TKUS: Mining Top-K High-Utility Sequential Patterns

Chunkai Zhang, Zilin Du|arXiv (Cornell University)|Nov 26, 2020
Data Mining Algorithms and Applications参考文献 45被引用 6
一句话总结

本文提出 TKUS,一种新颖的算法,用于在定量序列数据库中挖掘 top-k 高单位序列模式(HUSPs)。通过利用投影与局部搜索机制,并结合序列单位提升(Sequence Utility Raising)、提前终止后代(Terminate Descendants Early)和消除无前景项目(Eliminate Unpromising Items)等策略,TKUS 有效剪枝搜索空间,在多种数据集上实现了比现有最先进方法更优的运行时间、内存使用和可扩展性表现。

ABSTRACT

High-utility sequential pattern mining (HUSPM) has recently emerged as a focus of intense research interest. The main task of HUSPM is to find all subsequences, within a quantitative sequential database, that have high utility with respect to a user-defined minimum utility threshold. However, it is difficult to specify the minimum utility threshold, especially when database features, which are invisible in most cases, are not understood. To handle this problem, top-k HUSPM was proposed. Up to now, only very preliminary work has been conducted to capture top-k HUSPs, and existing strategies require improvement in terms of running time, memory consumption, unpromising candidate filtering, and scalability. Moreover, no systematic problem statement has been defined. In this paper, we formulate the problem of top-k HUSPM and propose a novel algorithm called TKUS. To improve efficiency, TKUS adopts a projection and local search mechanism and employs several schemes, including the Sequence Utility Raising, Terminate Descendants Early, and Eliminate Unpromising Items strategies, which allow it to greatly reduce the search space. Finally, experimental results demonstrate that TKUS can achieve sufficiently good top-k HUSPM performance compared to state-of-the-art algorithm TKHUS-Span.

研究动机与目标

  • 为解决在高单位序列模式挖掘(HUSPM)中设定合适最小单位阈值的挑战,该挑战常因缺乏领域知识而难以确定。
  • 系统性地形式化 top-k HUSPM 问题,首次提供明确定义的问题陈述。
  • 设计一种高效算法,减少搜索空间,并在运行时间、内存消耗和可扩展性方面提升性能。
  • 在多种真实世界和合成数据集上,超越现有最先进算法(如 TKHUS-Span)在挖掘 top-k HUSPs 方面的表现。

提出的方法

  • TKUS 采用投影与局部搜索机制,将计算聚焦于有前景的子序列分支,从而减少全局搜索空间。
  • 集成序列单位提升(SUR)策略,以在搜索早期估算并优先处理高单位候选。
  • 提前终止后代(TDE)策略通过剪枝那些单位无法超过当前第 k 个最高单位的子树,避免不必要的探索。
  • 消除无前景项目(EUI)策略基于单位边界和序列结构,移除无法对 top-k HUSPs 有贡献的项目。
  • TKUS 维护 1-序列和 2-序列的单位与 PEU(投影估计单位)值,以高效指导剪枝和候选生成。
  • 算法通过 SUR 动态调整最小单位阈值,以加速收敛并减少候选生成。

实验结果

研究问题

  • RQ1如何系统性地正式定义并形式化 top-k 高单位序列模式挖掘问题?
  • RQ2哪些算法策略能有效减少 top-k HUSPM 中的搜索空间,同时不损害完备性?
  • RQ3TKUS 在运行时间、内存使用和可扩展性方面与现有最先进算法(如 TKHUS-Span)相比表现如何?
  • RQ4不同剪枝策略(SUR、TDE 和 EUI)对 top-k HUSPM 的效率和性能有何影响?
  • RQ5TKUS 的性能如何随数据集大小增加以及 k 值变化而扩展?

主要发现

  • 在所有测试数据集上,TKUS 的执行时间显著快于 TKHUS-Span,且随着 k 值增大,性能差距在大型数据集上更加明显。
  • 在五组测试数据中的四组中,TKUS 的内存使用量低于 TKHUS-Span,尤其得益于有效剪枝策略带来的候选处理减少。
  • TKUS 的内存使用随 k 增大而增加,但在某些数据集(如 Sign 数据集)上表现出非单调行为,例如在 k=1000 时出现急剧下降。
  • 在合成数据库(从 10K 到 120K 条序列)上,TKUS 在运行时间和内存使用方面均表现出线性可扩展性。
  • TKUS 在多种数据集(包括真实世界数据 Yoochoose、Sign、Kosarak、Syn80k 和合成数据)上表现出稳定性能,证实了其鲁棒性和泛化能力。
  • 尽管在 Yoochoose 数据集上因大量 1-序列和 2-序列计算导致计算成本较高,TKUS 仍保持整体竞争力和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。