[论文解读] Hierarchical Agglomerative Graph Clustering in Poly-Logarithmic Depth
本文提出 ParHAC,这是首个针对相似度图上平均链接 HAC 的并行分层聚合聚类算法,具有对数多对数时间复杂度和近线性工作量。它在 Õ(m) 工作量和 O(log⁴n) 深度下实现了 (1+ε)-近似,支持大规模图的可扩展聚类——例如在通用机器上,1240亿条边的图可在 3.5 小时内完成聚类,同时保持与精确 HAC 相当的聚类质量。
Obtaining scalable algorithms for hierarchical agglomerative clustering (HAC) is of significant interest due to the massive size of real-world datasets. At the same time, efficiently parallelizing HAC is difficult due to the seemingly sequential nature of the algorithm. In this paper, we address this issue and present ParHAC, the first efficient parallel HAC algorithm with sublinear depth for the widely-used average-linkage function. In particular, we provide a $(1+ε)$-approximation algorithm for this problem on $m$ edge graphs using $ ilde{O}(m)$ work and poly-logarithmic depth. Moreover, we show that obtaining similar bounds for exact average-linkage HAC is not possible under standard complexity-theoretic assumptions. We complement our theoretical results with a comprehensive study of the ParHAC algorithm in terms of its scalability, performance, and quality, and compare with several state-of-the-art sequential and parallel baselines. On a broad set of large publicly-available real-world datasets, we find that ParHAC obtains a 50.1x speedup on average over the best sequential baseline, while achieving quality similar to the exact HAC algorithm. We also show that ParHAC can cluster one of the largest publicly available graph datasets with 124 billion edges in a little over three hours using a commodity multicore machine.
研究动机与目标
- 为解决由于分层聚合聚类(HAC)固有的顺序性而长期存在的并行化难题。
- 设计一种并行 HAC 算法,实现次线性深度和近线性工作量,同时保持高聚类质量。
- 提供首个针对相似度图上平均链接的、具有对数多对数时间复杂度的 (1+ε)-近似 HAC 算法。
- 在真实世界和合成数据集上展示实际可扩展性和聚类质量,包括百亿条边的图。
- 通过证明在标准复杂度假设下,实现类似边界的精确平均链接 HAC 并行化在理论上极不可能,揭示其理论极限。
提出的方法
- 采用相似度图表示法,其中每个点为一个顶点,边表示非零相似度,将输入规模从 O(n²) 降低至 O(m)。
- 引入一种新颖的并行数据结构,以高效维护和更新聚类相似度,支持并发的合并决策。
- 采用基于递归聚类策略的图的分层分解方法,同时满足 (1+ε)-近似保证。
- 利用随机采样和稀疏化技术,避免存储完整相似度矩阵,从而保持近似聚类相似度。
- 采用工作-深度模型分析性能,确保在高概率下实现 Õ(m) 的期望工作量和 O(log⁴n) 的深度。
- 集成一种动态优先队列抽象,以高效并行选择下一次合并操作,最小化依赖链。
实验结果
研究问题
- RQ1分层聚合聚类能否被并行化,以实现对数多对数时间复杂度,同时保持高质量聚类?
- RQ2能否设计一种 (1+ε)-近似 HAC 算法,实现近线性工作量和次线性深度,用于平均链接聚类?
- RQ3在标准复杂度假设下,并行化精确平均链接 HAC 的理论极限是什么?
- RQ4所提出的并行算法在真实世界数据集上的质量与性能,与串行和现有并行基线相比如何?
- RQ5该算法能否在通用硬件上实现对大规模图(如超过 1000 亿条边)的可扩展聚类?
主要发现
- ParHAC 在一系列真实世界数据集上,相对于最佳串行基线实现了平均 50.1 倍加速,同时保持与精确 HAC 相当的聚类质量。
- 该算法在高概率下实现 Õ(m) 的期望工作量和 O(log⁴n) 的深度,具有工作效率高且高度可并行化的特点。
- ParHAC 在通用多核机器上于 3.5 小时内完成对 1240 亿条边图的聚类,展示了实际可扩展性。
- 该方法为平均链接 HAC 提供 (1+ε)-近似,确保每一步的合并决策与最优选择相差不超过 (1+ε) 因子。
- 理论分析表明,在标准复杂度假设下,实现类似边界的精确平均链接 HAC 并行化极不可能,凸显了近似方法的必要性。
- 在多样化数据集(包括合成数据、UCI、GeoLife 和 CHEM)上的实证评估,证实了在 ARI、NMI 和 Dasgupta 成本等多个指标上的一致高质量结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。