[论文解读] On SAT Models Enumeration in Itemset Mining
本文研究了基于CDCL的SAT求解器在SAT编码的频繁项集挖掘中高效枚举模型的适应性。研究发现,由于减少了从子句学习和阻塞机制带来的开销,采用Jeroslow-Wang分支启发式的简单DPLL类过程在模型数量较多的实例上优于带有阻塞子句的CDCL求解器。
Frequent itemset mining is an essential part of data analysis and data mining. Recent works propose interesting SAT-based encodings for the problem of discovering frequent itemsets. Our aim in this work is to define strategies for adapting SAT solvers to such encodings in order to improve models enumeration. In this context, we deeply study the effects of restart, branching heuristics and clauses learning. We then conduct an experimental evaluation on SAT-Based itemset mining instances to show how SAT solvers can be adapted to obtain an efficient SAT model enumerator.
研究动机与目标
- 通过适配CDCL求解器组件,提升基于SAT的频繁项集挖掘中模型枚举的效率。
- 研究重启、分支启发式和子句学习对模型枚举性能的影响。
- 比较带有阻塞子句的DPLL类过程与CDCL基求解器在枚举闭合频繁项集方面的表现。
- 识别在输出规模呈指数级增长的数据挖掘问题的SAT编码中最有效的求解器配置。
- 为子句学习和阻塞子句在高模型数量场景下的局限性提供实证证据。
提出的方法
- 实现了一个无阻塞或学习子句的DPLL类模型枚举器(DPLL-Enum),以隔离求解器组件的影响。
- 在MiniSAT 2.2的CDCL求解器中扩展了模型枚举过程(CDCL-Enum),通过添加无解子句并在每次找到一个模型后触发重启。
- 在DPLL-Enum框架内评估了三种分支启发式:VSIDS、Jeroslow-Wang(JW)和随机选择。
- 使用cactus图比较了来自FIMI和CP4IM仓库的多个数据集在不同最小支持度阈值下的CPU时间。
- 在配备四核Intel Xeon处理器的机器上进行实验,每个实例设置15分钟的CPU时间限制。
- 在多样化的真实世界数据集上测量性能,重点关注闭合频繁项集的枚举。
实验结果
研究问题
- RQ1重启、分支启发式和子句学习如何影响SAT求解器在项集挖掘模型枚举中的性能?
- RQ2在SAT编码的项集挖掘中,基于CDCL的方法(使用阻塞子句和子句学习)是否比纯DPLL类过程更高效?
- RQ3在DPLL类模型枚举中,哪种分支启发式——VSIDS、Jeroslow-Wang还是随机选择——表现最佳?
- RQ4当SAT编码中存在指数级多的模型时,子句学习和阻塞子句是否反而具有反效果?
- RQ5在高模型数量的模型枚举任务中,轻量级的DPLL类过程能否超越最先进的CDCL求解器?
主要发现
- DPLL类过程(DPLL-Enum)在大多数实例上优于基于CDCL的方法(CDCL-Enum),尤其是在模型数量较多的实例上。
- DPLL-Enum+JW变体(Jeroslow-Wang启发式)在多个数据集上始终优于DPLL-Enum+VSIDS和DPLL-Enum+RAND。
- 在chess、kr-vs-kp和splice-1等数据集上,DPLL-Enum+JW显著减少了枚举时间,优于其他启发式和CDCL方法。
- CDCL-Enum和DPLL-Enum+RAND在多个实例中未能在15分钟超时内完成枚举,表明其可扩展性较差。
- 在CDCL-Enum中使用阻塞子句和子句学习引入了显著开销,使其在高模型数量问题中不切实际。
- 结果表明,当模型数量较大时,子句学习和阻塞子句对模型枚举具有负面影响,更倾向于采用简单的DPLL类策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。