Skip to main content
QUICK REVIEW

[论文解读] Local dominance unveils clusters in networks

Shi, Dingyi, Fan Shang|arXiv (Cornell University)|Sep 30, 2022
Complex Network Analysis Techniques参考文献 81被引用 12
一句话总结

本文提出了一种新颖的社区检测算法 Local Search (LS),通过仅使用局部拓扑信息和广度优先搜索,利用局部主导性(local dominance)识别社区中心——即高学位节点在其邻域内主导低学位邻居。该方法时间复杂度为线性,能检测社区内部及跨社区的自然层次结构,在合成网络与真实网络(包括向量数据)上均优于现有方法,对噪声具有高度鲁棒性,并在基准测试中取得优异的 F1 分数。

ABSTRACT

Clusters or communities can provide a coarse-grained description of complex systems at multiple scales, but their detection remains challenging in practice. Community detection methods often define communities as dense subgraphs, or subgraphs with few connections in-between, via concepts such as the cut, conductance, or modularity. Here we consider another perspective built on the notion of local dominance, where low-degree nodes are assigned to the basin of influence of high-degree nodes, and design an efficient algorithm based on local information. Local dominance gives rises to community centers, and uncovers local hierarchies in the network. Community centers have a larger degree than their neighbors and are sufficiently distant from other centers. The strength of our framework is demonstrated on synthesized and empirical networks with ground-truth community labels. The notion of local dominance and the associated asymmetric relations between nodes are not restricted to community detection, and can be utilised in clustering problems, as we illustrate on networks derived from vector data.

研究动机与目标

  • 为解决在复杂网络中检测社区的挑战,提出一种能显式识别社区中心与层次结构的方法。
  • 开发一种仅依赖局部拓扑信息的社区检测算法,避免使用全局优化或相似性度量。
  • 相比依赖启发式目标函数或全局零模型的现有方法,提升对噪声和虚假社区的鲁棒性。
  • 通过将离散化数据点云视为网络,将该框架扩展至向量数据,使方法可应用于传统聚类问题。
  • 提供一种统一方法,模拟度量空间聚类中的中心点与距离层次结构,适用于网络结构。

提出的方法

  • 定义局部主导性:若一个节点的度高于其邻居,且与其它主导节点保持足够距离,则其为局部领导者。
  • 从每个潜在领导者出发使用广度优先搜索(BFS),将节点分配至其影响区域,形成有根树。
  • 将局部领导者中度高于邻居且影响区域重叠最小的节点识别为社区中心,确保中心之间的分离。
  • 基于主导性构建节点的部分排序,形成层次结构,使领导者在其局部区域内主导追随者。
  • 仅使用局部信息迭代应用该算法,确保时间复杂度为 O(N),其中 N 为节点数。
  • 通过邻近性或 k-近邻方法将向量数据映射为网络,再应用 LS 检测聚类,类比于度量空间中的聚类。

实验结果

研究问题

  • RQ1是否可仅通过局部主导性在不依赖全局优化或相似性度量的前提下,定义网络中的社区中心与层次结构?
  • RQ2LS 算法在具有已知真实社区结构的合成与实证网络上的表现如何,相较于最先进方法?
  • RQ3LS 在将高维向量数据转换为网络表示后,能否有效检测出有意义的聚类?
  • RQ4LS 对随机边扰动(添加或删除)以及对高学位节点的针对性攻击的鲁棒性如何?
  • RQ5LS 在向量数据基准测试中是否优于传统聚类方法,特别是在重叠或噪声聚类场景下?

主要发现

  • 在 S-sets 数据集上,LS 在社区重叠逐渐增加的情况下仍保持 0.99、0.94、0.74 和 0.62 的高 F1 分数,表现出极强的鲁棒性。
  • 在 Clusterable-data 数据集上,LS 在识别聚类与噪声方面与 HDBSCAN 表现相当,灰色点代表噪声或类似光环的区域。
  • 在六种真实网络中,LS 在随机删除或添加边的情况下,F1 分数均高于 Louvain,表明对缺失或虚假连接具有更强鲁棒性。
  • 在针对性失效场景中,连接最大节点常导致检测到的社区数量减少,因领导者可能被更强的领导者所吸收,表明对结构扰动敏感。
  • 在 Olivetti 人脸数据库(92×112 维)上,LS 识别出 33 个聚类中心,并在 F1 分数基准测试中优于 DDB 算法,表现出优异的聚类性能。
  • 该方法在合成与实证网络中均成功检测到自然层次结构与社区中心,社区中心的度高于其邻居,且分布良好分离。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。