Skip to main content
QUICK REVIEW

[论文解读] Generalized network community detection

Lovro Šubelj, Marko Bajec|arXiv (Cornell University)|Oct 12, 2011
Complex Network Analysis Techniques参考文献 49被引用 7
一句话总结

该论文提出了一种基于模型的标签传播算法,用于广义网络社区检测,能够在不预先知道社区数量的情况下识别出基于链接密度和链接模式的社区。通过利用节点聚类系数来优化社区建模,该方法在合成网络和真实世界网络(包括单部图、二部图及软件依赖网络)以及预测性数据聚类任务中均实现了最先进性能。

ABSTRACT

Community structure is largely regarded as an intrinsic property of complex real-world networks. However, recent studies reveal that networks comprise even more sophisticated modules than classical cohesive communities. More precisely, real-world networks can also be naturally partitioned according to common patterns of connections between the nodes. Recently, a propagation based algorithm has been proposed for the detection of arbitrary network modules. We here advance the latter with a more adequate community modeling based on network clustering. The resulting algorithm is evaluated on various synthetic benchmark networks and random graphs. It is shown to be comparable to current state-of-the-art algorithms, however, in contrast to other approaches, it does not require some prior knowledge of the true community structure. To demonstrate its generality, we further employ the proposed algorithm for community detection in different unipartite and bipartite real-world networks, for generalized community detection and also predictive data clustering.

研究动机与目标

  • 解决现有社区检测方法需要预先知道社区数量或仅假设存在基于链接密度的社区的局限性。
  • 开发一种更准确且可泛化的社区建模策略,以同时捕捉紧密连接(链接密度)和结构模式(链接模式)的社区。
  • 在多样化的基准网络和真实世界数据集上评估该算法,包括单部图和二部图,以及数据聚类应用。
  • 展示该方法在广义社区检测和预测性聚类中的有效性,证明其在不同网络类型和结构下的鲁棒性。

提出的方法

  • 通过引入基于节点聚类系数的社区建模策略,对标签传播算法(LPA)进行改进,以更好地捕捉结构模式。
  • 将先前工作中基于凝聚度的社区参数替换为基于聚类系数的度量,以提高社区检测的准确性。
  • 采用加权标签传播,其中每个节点采纳其邻居中出现频率最高的标签,权重由链接强度决定。
  • 迭代应用该算法直至收敛,当不再发生标签变化时,社区标签即稳定。
  • 通过邻接矩阵表示网络并采用块模型重排来可视化和验证检测到的社区。
  • 通过使用逆切比雪夫距离构建相似性网络并对结果进行截断以实现稀疏化,将该方法应用于数据聚类。

实验结果

研究问题

  • RQ1是否存在一种社区检测算法,能够在不预先知道真实社区数量的情况下,同时检测出基于链接密度和链接模式的社区?
  • RQ2基于节点聚类系数的社区建模与基于凝聚度的建模相比,在准确性和鲁棒性方面表现如何?
  • RQ3该方法在包括单部图、二部图及软件依赖网络在内的多种网络类型中,其泛化能力如何?
  • RQ4与经典的K-Means和基于模型的EM聚类方法相比,该算法在预测性数据聚类任务中的有效性如何?
  • RQ5在具有预设分区和分辨率极限示例的基准网络上,该方法是否优于当前最先进算法?

主要发现

  • 所提出的MPC(基于模型的传播算法)在Zachary空手道网络上达到0.7386的NMI,优于以往方法。
  • 在Davis女性网络中,MPC达到0.7369的NMI,表明其在真实世界社交网络中表现强劲。
  • 在javax Java软件依赖网络中,MPC达到0.7431的NMI,准确恢复了高层软件包作为社区。
  • 在数据聚类中,MPC在Iris数据集上达到0.8264的NMI,在Ecoli数据集上达到0.6251的NMI,两种情况下均优于K-Means和MM(EM)。
  • MPC在Ecoli数据集上显著优于MM(EM),后者仅获得0.0797的NMI,表明在相同条件下表现极差。
  • 该方法成功识别出javax网络中基于链接密度和链接模式的社区,其中部分包(如javax.swing)形成链接模式社区,而其他包(如javax.xml)则形成链接密度社区。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。