[论文解读] A Tabu Search based clustering algorithm and its parallel implementation on Spark
本文提出了一种增强型K均值聚类算法,结合禁忌搜索以避免陷入局部最优,从而提升收敛速度与解的质量,并在Apache Spark上高效实现,适用于大规模数据工作负载。实验结果表明,与Spark MLlib的标准K均值相比,该算法在可扩展性、准确性和有效性方面表现更优。
The well-known K-means clustering algorithm has been employed widely in different application domains ranging from data analytics to logistics applications. However, the K-means algorithm can be affected by factors such as the initial choice of centroids and can readily become trapped in a local optimum. In this paper, we propose an improved K-means clustering algorithm that is augmented by a Tabu Search strategy, and which is better adapted to meet the needs of big data applications. Our design is further enhanced to take advantage of parallel processing based on the Spark framework. Computational experiments demonstrate the superiority of our Tabu Search based clustering algorithm over a widely used version of the K-means approach embodied in Spark MLlib, comparing the algorithms in terms of scalability, accuracy, and effectiveness.
研究动机与目标
- 解决K均值对初始质心选择的敏感性及其易收敛至局部最优的问题。
- 通过将禁忌搜索元启发式策略整合到K均值框架中,提升聚类质量。
- 利用Spark分布式计算框架,实现在大规模数据上的高效、可扩展聚类。
- 评估所提算法在准确率、可扩展性和计算效率方面相较于最先进实现的性能表现。
提出的方法
- 在标准K均值算法中引入禁忌搜索机制,通过维护近期访问解的短期记忆,帮助跳出局部最优。
- 利用禁忌列表限制对特定质心配置的移动,促进搜索空间的多样化。
- 基于质心重新定位设计邻域结构,以探索其他聚类解。
- 使用Apache Spark的弹性分布式数据集(RDD)实现分布式计算,实现高效的数据分区与并行执行。
- 将禁忌搜索逻辑集成到Spark的迭代计算模型中,支持多轮改进。
- 通过最小化数据洗牌和最大化集群节点间的内存计算,优化通信开销。
实验结果
研究问题
- RQ1禁忌搜索能否在高维和大规模数据集中有效提升K均值的解质量?
- RQ2与标准K均值相比,该算法在收敛速度和稳定性方面表现如何?
- RQ3基于Spark的并行化在多大程度上提升了禁忌搜索-K均值混合算法的可扩展性?
- RQ4该算法在准确率和运行时效率方面与Spark MLlib的K均值实现相比表现如何?
主要发现
- 所提出的基于禁忌搜索的K均值算法在多个基准数据集上,聚类准确率显著优于Spark MLlib的K均值。
- 该算法展现出更优的可扩展性,得益于对Spark的优化集成,能更高效地处理大规模数据集。
- 计算实验证实,禁忌搜索机制显著降低了收敛至次优局部最优的可能性。
- 在Spark上的并行实现保持了良好的负载均衡,并最小化了通信开销,实现了集群间的高效分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。