[论文解读] Scaling Fine-grained Modularity Clustering for Massive Graphs
该论文提出 gScarf,一种在大规模图上进行细粒度模块化聚类的高效算法,通过 LRM-增益缓存和增量子图折叠技术动态剪枝不必要的节点和边。该方法在保持与 CorMod 相当的聚类精度的同时,实现了最先进的运行速度,通过似然比模块化最大化避免了分辨率极限问题。
Modularity clustering is an essential tool to understand complicated graphs. However, existing methods are not applicable to massive graphs due to two serious weaknesses. (1) It is difficult to fully reproduce ground-truth clusters due to the resolution limit problem. (2) They are computationally expensive because all nodes and edges must be computed iteratively. This paper proposes gScarf, which outputs fine-grained clusters within a short running time. To overcome the aforementioned weaknesses, gScarf dynamically prunes unnecessary nodes and edges, ensuring that it captures fine-grained clusters. Experiments show that gScarf outperforms existing methods in terms of running time while finding clusters with high accuracy.
研究动机与目标
- 为解决模块化聚类中的分辨率极限问题,该问题在大规模图中导致聚类粒度过粗。
- 降低现有模块化聚类方法的高计算成本,特别是针对十亿条边的图。
- 开发一种高效算法,在显著提升运行时间的同时保持 CorMod 的高聚类质量。
- 实现在无需用户指定参数的情况下,将细粒度模块化聚类实用化部署于真实世界的大规模图上。
提出的方法
- gScarf 引入了似然比模块化(LRM)的增量形式,称为 LRM-增益,以实现聚类质量的高效增量计算。
- 基于 LRM 的确定性特性,采用 LRM-增益缓存机制,避免对结构属性相同的聚类重复计算。
- 通过增量子图折叠技术动态合并节点和边,从而在聚类过程中减少搜索空间。
- 通过确定性剪枝策略,跳过无法提升当前聚类质量的节点和边的 LRM-增益计算。
- 该方法被设计为与 CorMod 的贪心 LRM 最大化等价,确保聚类质量无损失。
- 通过分别处理入度和出度,修改度计算方式,支持有向图中的 LRM-增益和折叠操作。
实验结果
研究问题
- RQ1我们能否在不损失与最先进方法相比的精度的前提下,实现在大规模图上的细粒度模块化聚类?
- RQ2如何在保持检测真实聚类大小能力的同时,降低大规模图中 LRM 最大化的计算成本?
- RQ3哪些动态剪枝策略可应用于基于 LRM 的聚类,而不会遗漏提升模块化的机遇?
- RQ4LRM-增益能否被增量计算并有效缓存,以加速大规模图上的聚类?
- RQ5所提出方法在不同图大小和结构复杂度下(尤其是在高混合参数下)的可扩展性如何?
主要发现
- 在真实图(YT、LJ、OK)上,gScarf 的 NMI 分数高于 Louvain 和 IncMod,接近或略高于 CorMod 的表现。
- 在 LFR 基准图上,随着混合参数(mu)变化,gScarf 在 mu = 0.9 时仍保持高 NMI 分数,而其他方法显著下降。
- 对于最大达 10^7 个节点的大图,gScarf 在 NMI 上始终优于其他方法,表现出对规模的强鲁棒性。
- gScarf 在真实图和合成图中均能成功复现真实聚类大小,证实其有效避免了分辨率极限问题。
- 该算法运行速度显著快于 CorMod 及其他最先进方法,理论时间复杂度低于 O(nm log n)。
- gScarf 的 LRM-增益缓存与增量折叠技术确保了聚类质量无损失,理论引理证明了不会遗漏任何改进机会。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。