Skip to main content
QUICK REVIEW

[论文解读] Massively Parallel Algorithms and Hardness for Single-Linkage Clustering Under $\ell_p$-Distances

Grigory Yaroslavtsev, Adithya Vadapalli|arXiv (Cornell University)|Oct 4, 2017
Advanced Clustering Algorithms Research参考文献 3被引用 21
一句话总结

本论文首次提出了在 $\varepsilon_p$-距离(汉明距离、$\ell_1$、$\ell_2$、$\ell_\infty$)下单链聚类的海量并行算法,在固定维度 $d$ 下实现了 $O(\log n)$ MPC 轮次的 $(1+\epsilon)$-近似。同时,证明了在标准 MPC 硬度假设下,$o(\log n)$-轮次算法无法实现常数因子近似。通过 Spark 实验验证了性能,显示出数量级的加速效果。

ABSTRACT

We present massively parallel (MPC) algorithms and hardness of approximation results for computing Single-Linkage Clustering of $n$ input $d$-dimensional vectors under Hamming, $\ell_1, \ell_2$ and $\ell_\infty$ distances. All our algorithms run in $O(\log n)$ rounds of MPC for any fixed $d$ and achieve $(1+ε)$-approximation for all distances (except Hamming for which we show an exact algorithm). We also show constant-factor inapproximability results for $o(\log n)$-round algorithms under standard MPC hardness assumptions (for sufficiently large dimension depending on the distance used). Efficiency of implementation of our algorithms in Apache Spark is demonstrated through experiments on a variety of datasets exhibiting speedups of several orders of magnitude.

研究动机与目标

  • 在大规模向量数据的单链聚类问题中,于大规模并行计算(MPC)模型下,为常见 $\ell_p$-距离设计高效且可扩展的算法。
  • 填补 MPC 模型下单链聚类在可证明保证方面的空白,因为先前工作集中于 $k$-均值或 $k$-中位数,或对向量数据缺乏效率。
  • 通过证明在标准 MPC 硬度假设下,$o(\log n)$-轮次算法无法在 $\ell_p$-距离下实现 $k$-SLC 的常数因子近似,确立理论极限。
  • 通过在 Apache Spark 上的实现与评估,展示实际效率,覆盖多种数据集。

提出的方法

  • 利用 $k$-SLC 与最小生成树(MST)中第 $k-1$ 长边之间的等价性,通过模拟 Boruvka 算法实现 MPC 友好的 MST 构造。
  • 采用基于 $\ell_p$-距离划分与近似最近邻(ANN)搜索的分层聚类方法,使用参数 $\eta$ 控制近似程度与局部性。
  • 采用递归划分策略,根据距离阈值对向量进行分组,并在缓存的数据子集上使用 Prim 算法进行本地 MST 计算。
  • 使用 $\eta$-参数化的 ANN 过滤机制,通过仅关注距离范围不断缩小的候选邻居,减少通信与本地计算开销。
  • 实现多轮 MPC 框架,每轮执行本地聚类与机器间通信,基于簇间距离合并簇。
  • 将理论 MPC 保证与实际 Spark 优化相结合,包括缓存感知的数据布局与簇边界的迭代优化。

实验结果

研究问题

  • RQ1在 MPC 模型下,能否高效求解 $\ell_p$-距离下的单链聚类,并提供可证明的近似保证?
  • RQ2在 MPC 模型下,实现 $k$-SLC 在 $\ell_p$-距离下的 $(1+\epsilon)$-近似,其轮次复杂度上限是多少?
  • RQ3MPC 模型中是否存在固有局限,使得子对数轮次算法无法实现 $k$-SLC 的常数因子近似?
  • RQ4在基于 ANN 的过滤中,$\eta$ 的选择如何影响实际应用中的近似质量与运行时间性能?
  • RQ5理论 MPC 算法能否在真实系统(如 Apache Spark)中高效实现,并相较于串行方法实现显著加速?

主要发现

  • 所提出的 MPC 算法在任意固定维度 $d$ 下,于 $O(\log n)$ 轮次内实现了 $\ell_1$、$\ell_2$ 与 $\ell_\infty$ 距离下 $k$-SLC 的 $(1+\epsilon)$-近似。
  • 针对汉明距离情况,提供了精确算法,同样在 $O(\log n)$ 轮次内完成。
  • 在标准 MPC 硬度假设下,当维度足够大时,$o(\log n)$-轮次算法无法实现 $\ell_p$-距离下 $k$-SLC 的常数因子近似。
  • 在 Apache Spark 上的实验评估显示,相较于串行的 Prim 算法,实现了数个数量级的加速,尤其当本地数据可放入 L2 缓存时效果更显著。
  • 当 $\eta \approx 0.5$ 且近似值 $\approx 1.15$ 时,性能出现显著跃升,对应本地输入恰好可放入 L2 缓存的临界点,从而实现显著加速。
  • 所有数据集的算法最多在 40 轮内终止,且 $\ell_1$ 与 $\ell_\infty$ 下的表现与 $\ell_2$ 相当,原因在于共享相同的划分逻辑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。