[论文解读] Redesigning pattern mining algorithms for supercomputers
本文提出了一种高度可扩展的、面向超算的分布式内存并行算法,用于闭项集挖掘,通过基于超立方体的通信模型与多个分布式栈,实现负载均衡并最小化通信瓶颈。该方法在1200个核心上对大规模个人基因组数据中的统计显著突变模式进行挖掘时,实现了高达1175倍的加速,优于朴素并行化和单核基线方法在密集数据集上的表现。
Upcoming many core processors are expected to employ a distributed memory architecture similar to currently available supercomputers, but parallel pattern mining algorithms amenable to the architecture are not comprehensively studied. We present a novel closed pattern mining algorithm with a well-engineered communication protocol, and generalize it to find statistically significant patterns from personal genome data. For distributing communication evenly, it employs global load balancing with multiple stacks distributed on a set of cores organized as a hypercube with random edges. Our algorithm achieved up to 1175-fold speedup by using 1200 cores for solving a problem with 11,914 items and 697 transactions, while the naive approach of separating the search space failed completely.
研究动机与目标
- 解决未来大规模核心超算架构中缺乏可扩展的、面向分布式内存的模式挖掘算法的问题。
- 实现对密集的、大规模个人基因组数据(如HapMap和MCF7数据集的突变谱)中统计显著模式的高效挖掘。
- 通过在具有随机边的超立方体上分布栈结构,实现全局负载均衡,克服并行搜索中的通信瓶颈。
- 将多重检验程序(LAMP)与并行模式挖掘集成,以确保家庭错误率控制正确。
- 与朴素或共享内存方法相比,展示在计算密集型、高密度模式挖掘工作负载上的优越可扩展性和性能。
提出的方法
- 该算法基于LCM(线性时间闭项集挖掘器)框架,但通过将多个搜索栈分布在计算节点的超立方体拓扑上,重新设计为面向分布式内存的架构。
- 采用全局负载均衡策略,每个核心维护一个本地栈,并通过随机边结构从相邻核心动态拉取工作,以平衡通信与计算。
- 通信协议使用具有随机边的超立方体,以均匀分布消息流量,避免热点,确保在不平衡树上进行深度优先搜索的高效并行化。
- 使用LAMP(无限维度多重检验程序)框架评估统计显著性,通过Tarone的P值边界应用类似Bonferroni的校正,以控制家庭错误率。
- 该算法将深度优先搜索与动态工作窃取机制结合,并通过支持度计数实现剪枝,从而高效探索大规模搜索空间。
- 实现针对高密度数据库进行了优化,性能针对大项集和高事务数量进行了调优,如个人基因组数据集所示。
实验结果
研究问题
- RQ1基于分布式内存的并行模式挖掘算法是否能在拥有数千个核心的超算上实现高可扩展性和负载均衡?
- RQ2基于超立方体的通信模型结合随机边,在并行模式挖掘过程中是否能有效减少通信瓶颈?
- RQ3将LAMP的多重检验校正与模式挖掘集成后,能在多大程度上提升大规模基因组数据中挖掘模式的统计可靠性?
- RQ4在密集的、高维数据集上,该算法与单核及朴素并行化实现相比,在加速比和可扩展性方面表现如何?
- RQ5该算法是否能高效应对从真实世界个人基因组数据中挖掘统计显著突变模式的计算需求?
主要发现
- 在包含11,914个项和697笔事务的数据集上,使用1200个核心时,所提算法实现了高达1175倍的加速,显著优于朴素并行化方法。
- 该算法成功扩展至1200个核心,在更复杂、更密集的问题上,加速比持续提升,表现出强劲的弱可扩展性。
- 对于HapMap主导20数据集,统计显著的项集(最多8个项)在20秒内被发现,而暴力方法无法完成此任务。
- 流水线的第三阶段(P值计算)每项集耗时不足10毫秒,表明统计校正步骤的开销极小。
- 尽管在稀疏数据集上,单核LAMP2优于并行实现,但所提方法在密集、大规模数据集上表现更优,尤其在核心数增加时优势更明显。
- 基于超立方体的通信模型有效平衡了工作负载,防止了通信热点,实现了对不平衡树上深度优先搜索的高效并行化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。