[论文解读] Theoretically-Efficient and Practical Parallel DBSCAN
该论文提出了在欧几里得空间中理论上高效且高度并行的DBSCAN算法,其工作复杂度与最佳串行算法相当,同时实现了对数多对数深度。作者实现了优化版本,在配备双路超线程的36核系统上,相较于最快的串行实现,速度提升最高达33倍;相较于现有并行DBSCAN算法,速度提升最高达6,102倍。
The DBSCAN method for spatial clustering has received significant attention due to its applicability in a variety of data analysis tasks. There are fast sequential algorithms for DBSCAN in Euclidean space that take $O(n\log n)$ work for two dimensions, sub-quadratic work for three or more dimensions, and can be computed approximately in linear work for any constant number of dimensions. However, existing parallel DBSCAN algorithms require quadratic work in the worst case, making them inefficient for large datasets. This paper bridges the gap between theory and practice of parallel DBSCAN by presenting new parallel algorithms for Euclidean exact DBSCAN and approximate DBSCAN that match the work bounds of their sequential counterparts, and are highly parallel (polylogarithmic depth). We present implementations of our algorithms along with optimizations that improve their practical performance. We perform a comprehensive experimental evaluation of our algorithms on a variety of datasets and parameter settings. Our experiments on a 36-core machine with hyper-threading show that we outperform existing parallel DBSCAN implementations by up to several orders of magnitude, and achieve speedups by up to 33x over the best sequential algorithms.
研究动机与目标
- 通过设计工作复杂度与串行算法相当但高度并行的算法,弥合并行DBSCAN在理论效率与实际性能之间的差距。
- 为欧几里得空间中的精确与近似DBSCAN设计并行算法,实现对数多对数深度与工作效率。
- 确保算法产生的聚类结果与标准DBSCAN完全一致,不损失质量。
- 针对共享内存系统优化实现,性能优于现有并行DBSCAN解决方案。
- 在不同参数设置下,于多样化合成与真实世界数据集上展示优越的可扩展性与性能。
提出的方法
- 通过盒子或网格划分设计并行2D精确DBSCAN,采用三种连通性判定方法:Delaunay三角剖分、带线分离的单位球面空置检测,以及双色最接近点对。
- 通过并行求解高维双色最接近点对问题,将方法扩展至高维精确DBSCAN。
- 利用四叉树构建与查询,设计并行近似DBSCAN算法,输出与Gan和Tao(2017)的串行近似算法一致。
- 通过无锁数据结构与高效的内存访问模式等优化手段,提升实际性能。
- 采用配备36个核心与双路超线程的共享内存架构,评估不同数据集与参数设置下的性能表现。
- 利用工作高效并行原语与高并行度(对数多对数深度),确保理论效率与实际可扩展性。
实验结果
研究问题
- RQ1能否设计出并行DBSCAN算法,使其工作复杂度与最佳串行算法相当,同时保持对数多对数深度?
- RQ2能否在不牺牲聚类质量或输出正确性的前提下,对精确DBSCAN进行并行化?
- RQ3能否高效地并行化近似DBSCAN,使其性能与串行近似算法相当,并在多核系统上良好扩展?
- RQ4在实际性能方面,所提出的并行算法相较于现有并行DBSCAN实现,其加速比与绝对性能如何?
- RQ5所提出的算法能否处理大规模数据集(包括此前被认为过大而无法进行精确DBSCAN处理的数据集),并优于分布式替代方案?
主要发现
- 所提出的精确DBSCAN实现版本在36核系统上实现了2–89倍(平均24倍)的自相对加速,相较于最快串行实现,加速比为5–33倍(平均16倍)。
- 近似DBSCAN实现版本实现了14–44倍(平均24倍)的自相对加速,表现出强大的可扩展性。
- 与现有并行DBSCAN算法相比,在最优参数设置下,最快精确实现版本的速度最高快6,102倍。
- 算法处理了文献中用于精确DBSCAN的最大数据集,并在相同的13维TeraClickLog数据集上,相较于最先进的分布式RP-DBSCAN算法,性能快18–577倍。
- 实现表现出极佳的并行效率,具有对数多对数深度,且工作复杂度与最佳串行算法相当。
- 结果证实,理论效率与实际性能可在并行DBSCAN中同时实现,从而填补了该领域长期存在的空白。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。