Skip to main content
QUICK REVIEW

[论文解读] PS-DBSCAN: An Efficient Parallel DBSCAN Algorithm Based on Platform Of AI (PAI)

Hu Xu, Jun Huang|arXiv (Cornell University)|Nov 3, 2017
Graph Theory and Algorithms被引用 5
一句话总结

PS-DBSCAN 是一种通信高效的并行 DBSCAN 算法,利用参数服务器框架和一种快速的全局合并方法,以减少在分布式聚类中的通信开销。通过使用并查集并最小化工作节点间的协调,其在不同规模的数据集上相比基于 MPI 的 PDSDBSCAN-D 实现了 2–10 倍的通信效率提升。

ABSTRACT

We present PS-DBSCAN, a communication efficient parallel DBSCAN algorithm that combines the disjoint-set data structure and Parameter Server framework in Platform of AI (PAI). Since data points within the same cluster may be distributed over different workers which result in several disjoint-sets, merging them incurs large communication costs. In our algorithm, we employ a fast global union approach to union the disjoint-sets to alleviate the communication burden. Experiments over the datasets of different scales demonstrate that PS-DBSCAN outperforms the PDSDBSCAN with 2-10 times speedup on communication efficiency. We have released our PS-DBSCAN in an algorithm platform called Platform of AI (PAI - https://pai.base.shuju.aliyun.com/) in Alibaba Cloud. We have also demonstrated how to use the method in PAI.

研究动机与目标

  • 为解决在核心点分布在多个工作节点时并行 DBSCAN 的高通信开销问题。
  • 通过在聚类合并过程中最小化工作节点间的协调,降低分布式 DBSCAN 中的通信开销。
  • 通过参数服务器架构提升大规模数据上基于密度的聚类的可扩展性和性能。
  • 在阿里巴巴人工智能平台(PAI)中提供一个可投入生产、可扩展的 DBSCAN 实现。

提出的方法

  • 该算法将数据点划分到多个工作节点,并使用并查集数据结构在本地管理聚类成员关系。
  • 每个工作节点使用 epsilon 邻域和 minPoints 条件执行本地聚类,以识别核心点并形成局部聚类。
  • 通过参数服务器框架将本地标签更新推送到中心服务器,应用一种快速的全局合并机制,以合并跨工作节点的并查集。
  • 使用迭代步骤——PropagateMaxLabel、MaxReduceToServer、PullFromServer、GlobalUnion 和 GetMaxLabel——来解决标签冲突并传播一致的聚类标签。
  • 全局标签向量由服务器维护,工作节点通过同步其本地标签以确保系统内的一致性。
  • 通过采用集中式协调模型,避免了昂贵的点对点通信,从而减少了消息数量和频率。

实验结果

研究问题

  • RQ1当聚类跨越多个工作节点时,如何最小化并行 DBSCAN 中的通信开销?
  • RQ2基于参数服务器的框架在通信效率方面是否能优于传统的基于 MPI 的实现?
  • RQ3PS-DBSCAN 的性能如何随数据集规模和处理核心数量的增加而扩展?
  • RQ4使用快速全局合并方法对分布式 DBSCAN 中聚类合并效率有何影响?

主要发现

  • PS-DBSCAN 在真实世界和合成数据集上相比基于 MPI 的 PDSDBSCAN-D 实现了 2–10 倍的通信效率提升。
  • 性能提升随着处理器核心数量和数据集规模的增加而增强,表明具有强大的可扩展性。
  • 该算法通过使用参数服务器进行集中式标签同步,替代点对点合并,显著降低了通信成本。
  • 采用快速全局合并方法显著减少了在工作节点间合并不相交集合所需的通信轮次。
  • PS-DBSCAN 已在阿里巴巴人工智能平台(PAI)中部署并成功演示,支持 MaxCompute 中的向量和链接格式输入。
  • 该实现表明,将多线程与分布式内存系统结合可进一步提升性能,为未来优化提供了可行路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。