Skip to main content
QUICK REVIEW

[论文解读] Distributed k-Core Decomposition

Alberto Montresor, Francesco De Pellegrini|arXiv (Cornell University)|Mar 28, 2011
Complex Network Analysis Techniques参考文献 8被引用 6
一句话总结

本文提出了一种用于大规模网络中k-core分解的新型分布式算法,实现了在分布式系统中的高效、可扩展计算。该方法采用基于消息传递的迭代局部更新,尽管理论上的上限表明收敛速度较慢,但在真实网络图上仅需少数轮次即可收敛。

ABSTRACT

Among the novel metrics used to study the relative importance of nodes in complex networks, k-core decomposition has found a number of applications in areas as diverse as sociology, proteinomics, graph visualization, and distributed system analysis and design. This paper proposes new distributed algorithms for the computation of the k-core decomposition of a network, with the purpose of (i) enabling the run-time computation of k-cores in "live" distributed systems and (ii) allowing the decomposition, over a set of connected machines, of very large graphs, that cannot be hosted in a single machine. Lower bounds on the algorithms complexity are given, and an exhaustive experimental analysis on real-world graphs is provided.

研究动机与目标

  • 解决在集中式计算不可行的大规模或实时分布式网络中对可扩展k-core分解的需求。
  • 实现在P2P覆盖网络等动态系统中的运行时k-core分析,其中coreness用于指导消息扩散协议。
  • 支持在单台机器内存无法容纳的超大规模图上进行分布式k-core分解计算。
  • 设计一种协议,能高效支持一对一(点对点)和一对多(基于集群)两种部署场景。
  • 在确保快速收敛至正确coreness值的同时,最小化通信开销,适用于真实网络拓扑。

提出的方法

  • 提出一种分布式算法,其中每个主机维护并基于其负责节点的本地度信息,持续更新其coreness估计值。
  • 采用多轮消息传递机制:每个节点向邻居广播其当前coreness估计值,然后根据自身度数与邻居估计值的最大值来更新自身值。
  • 应用关键优化:仅当coreness估计值发生变化时才发送更新消息,从而降低通信开销。
  • 支持点对点和广播通信模型,其中广播显著降低了每个节点的消息开销。
  • 通过将多个节点聚合至单一主机下,将一对一协议适配至一对多场景,同时保持正确性和收敛性。
  • 基于所有节点coreness估计值的收敛情况设定终止条件,并基于最坏情况图结构推导出轮次的理论上限。

实验结果

研究问题

  • RQ1如何在图数据过大而无法存储于单台机器内存中的分布式系统中,高效计算k-core分解?
  • RQ2分布式k-core算法在真实图上的收敛行为如何?与理论最坏情况边界相比有何差异?
  • RQ3该算法能否在几乎不降低性能的前提下,同时适配一对一(点对点)和一对多(基于集群)的部署模型?
  • RQ4该算法的通信开销是多少?其在不同网络拓扑和通信原语(如广播与点对点)下的表现如何变化?
  • RQ5考虑到coreness常用于流行病协议中的启发式消息传播,该算法在可接受误差范围内能多大程度实现提前终止?

主要发现

  • 理论上,该算法在O(N)轮内收敛,最坏情况轮次数上限为N - K + 1轮,其中K为最小度数节点的数量。
  • 尽管理论上限较高,但在Slashdot、Arxiv引用网络和Gnutella网络等真实图上,收敛轮数仅需22轮左右。
  • 到第22轮时,所有节点的最大误差降至1以内,平均误差迅速归零,表明即使在完全收敛前也具有高度准确性。
  • 在广播通信介质下,每个节点的平均更新消息数保持在3条以下,表明通信开销极低。
  • 在点对点通信中,通信开销随主机数量增加而上升,但会稳定在一对一协议的水平附近,显示出良好的可扩展性。
  • 由于其模块化、基于工作者的计算模型以及潜在的容错能力,该算法非常适合部署于Hadoop或Pregel类框架中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。