Skip to main content
QUICK REVIEW

[论文解读] Network modularity in the presence of covariates

Beate Franke, Patrick J. Wolfe|arXiv (Cornell University)|Mar 3, 2016
Complex Network Analysis Techniques参考文献 20被引用 5
一句话总结

本文通过推导极限定理,为网络模块性建立了正式的统计基础,使得在由节点协变量定义社区时,能够计算社区结构的p值。研究表明,在无社区结构的原假设下,模块性渐近服从正态分布,从而能够客观评估协变量定义的社区是否在包括加权、稀疏和幂律网络在内的多种网络类型中,有意义地解释网络模式。

ABSTRACT

We characterize the large-sample properties of network modularity in the presence of covariates, under a natural and flexible nonparametric null model. This provides for the first time an objective measure of whether or not a particular value of modularity is meaningful. In particular, our results quantify the strength of the relation between observed community structure and the interactions in a network. Our technical contribution is to provide limit theorems for modularity when a community assignment is given by nodal features or covariates. These theorems hold for a broad class of network models over a range of sparsity regimes, as well as weighted, multi-edge, and power-law networks. This allows us to assign $p$-values to observed community structure, which we validate using several benchmark examples in the literature. We conclude by applying this methodology to investigate a multi-edge network of corporate email interactions.

研究动机与目标

  • 为当社区由观测到的节点协变量定义而非仅从网络本身推断时,提供网络模块性的统计严谨解释。
  • 通过统计显著性量化社区结构的强度,超越模块性在启发式使用中的局限。
  • 开发一个非参数框架,可容纳多种网络类型,包括加权、多重边和幂律网络,且无需严格的参数假设。
  • 通过为模块性值分配p值,实现对协变量社区分配是否解释了观测到的网络结构的假设检验。
  • 通过正式关联协变量与网络拓扑结构,弥合网络分析中的可解释性鸿沟。

提出的方法

  • 将模块性推导为在无社区结构原假设下的总体对比估计量,即观测边权与期望边权之间的对比。
  • 采用基于度数的非参数模型,每个节点仅有一个参数表示其期望度数,避免对边权分布的分布假设。
  • 在原假设下建立模块性的中心极限定理,证明当不存在真实社区结构时,模块性渐近服从正态分布。
  • 提出一个灵活的框架,允许节点协变量定义社区分配,从而实现对其解释能力的统计检验。
  • 分析模块性估计量中的误差项,并在稀疏性和节点度分布假设下对其加以界定,证明其收敛于正态分布。
  • 使用基准网络验证该方法,并将其应用于具有多重边结构的真实企业电子邮件网络。

实验结果

研究问题

  • RQ1当社区由协变量而非从网络中推断时,模块性能否被正式解释为统计检验的检验量?
  • RQ2当协变量定义社区时,在无社区结构的原假设下,模块性的渐近分布是什么?
  • RQ3如何为观测到的模块性值分配p值,以系统性地评估其统计显著性?
  • RQ4节点协变量(如性别、种族或在校年份)在多大程度上能解释真实网络中观测到的社区结构?
  • RQ5所提出的方法在包括加权、稀疏和幂律网络在内的多种网络类型中是否保持有效性?

主要发现

  • 当社区由协变量定义时,在无社区结构的原假设下,模块性渐近服从正态分布,从而可计算p值。
  • 该方法在广泛的网络模型类别中有效,包括加权、多重边和幂律网络,且无需对边权分布作参数假设。
  • 该框架允许为观测到的模块性值分配p值,提供一种客观度量,以判断协变量定义的社区是否解释了网络结构。
  • 模块性的中心极限定理在一般稀疏性条件下成立,且无需对边权或度分布作强参数假设。
  • 该方法在基准网络上得到验证,并成功应用于企业电子邮件网络,展示了其在真实场景中的实用性。
  • 模块性估计量中的误差项被有界,并以速率 $\mathcal{O}(n^{-3/2})$ 收敛至零,确保在温和正则性条件下渐近正态性结果成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。