Skip to main content
QUICK REVIEW

[论文解读] A Spectral Algorithm with Additive Clustering for the Recovery of Overlapping Communities in Networks

Emilie Kaufmann, Thomas Bonald|arXiv (Cornell University)|Jun 12, 2015
Complex Network Analysis Techniques参考文献 39被引用 9
一句话总结

本文提出SAAC,一种谱算法,通过结合邻接矩阵的谱嵌入与加法聚类阶段,实现对网络中重叠社区的恢复。该方法在随机块模型(含重叠)下具有一致性,且无需事先知道社区数量,其在合成网络与真实网络上的表现优于现有方法。

ABSTRACT

This paper presents a novel spectral algorithm with additive clustering designed to identify overlapping communities in networks. The algorithm is based on geometric properties of the spectrum of the expected adjacency matrix in a random graph model that we call stochastic blockmodel with overlap (SBMO). An adaptive version of the algorithm, that does not require the knowledge of the number of hidden communities, is proved to be consistent under the SBMO when the degrees in the graph are (slightly more than) logarithmic. The algorithm is shown to perform well on simulated data and on real-world graphs with known overlapping communities.

研究动机与目标

  • 解决在社交、生物及合作者网络中常见的重叠社区检测挑战。
  • 克服传统非重叠社区检测方法在存在重叠时无法恢复原始社区的局限性。
  • 开发一种自适应谱算法,无需预先知晓社区数量,并在SBMO模型下具备一致性。
  • 在每个社区均具有正比例纯节点、且最小期望度数为对数级的假设下,为SBMO模型下的社区恢复提供理论保证。
  • 在模拟数据与真实数据集上均表现出优于现有方法的性能,包括一种新型预处理启发式方法。

提出的方法

  • 利用邻接矩阵的谱嵌入,基于前导特征向量将节点投影到低维空间。
  • 应用加法聚类阶段,将社区成员身份建模为嵌入空间中的加法贡献,从而实现重叠社区检测。
  • 将社区检测问题表述为在SBMO模型中估计成员矩阵Z,其中每个节点可通过二值成员向量属于多个社区。
  • 利用SBMO中的加法结构,设计一种直接从嵌入向量中恢复重叠社区的聚类过程。
  • 提出算法的自适应版本,通过数据驱动方法估计社区数量(ˆK),而无需先验知识。
  • 使用Frobenius范数与置换不变度量,评估并优化估计的成员矩阵ˆZ与真实Z之间的差异。

实验结果

研究问题

  • RQ1谱算法能否在无需预先知晓社区数量的情况下,恢复网络中的重叠社区?
  • RQ2利用SBMO模型中的加法结构是否能带来一致且准确的社区检测?
  • RQ3SAAC在存在重叠社区与稀疏网络时,相较于现有方法的性能如何?
  • RQ4每个社区中纯节点的比例对算法一致性与准确性有何影响?
  • RQ5基于邻接矩阵的谱方法,结合加法聚类,能否在重叠设置下超越更复杂的工具(如非回溯矩阵)?

主要发现

  • 当每个社区均具有正比例纯节点,且期望节点度数至少为网络规模的对数级时,SAAC在SBMO模型下实现了社区恢复的一致性。
  • 该算法在合成网络与真实网络(包括合作者网络与社交网络)上均优于现有方法,在恢复重叠社区方面达到最先进精度。
  • SAAC在稀疏网络中表现稳健,实验结果表明其在平均度数较低的网络中仍具高效性能。
  • 基于度数聚类(DC+SC)的预处理步骤可提升性能,通过识别纯节点,有助于在应用谱聚类前检测子社区。
  • 理论分析表明,SAAC可在非重叠情形下已知谱检测阈值以下实现社区恢复,表明在重叠设置下具有更高的灵敏度。
  • 图5的实证结果表明,与DC+SC基线相比,SAAC在中等至高重叠程度下始终能更准确地分类成员矩阵中的条目。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。