Skip to main content
QUICK REVIEW

[论文解读] Two-sample Test of Community Memberships of Weighted Stochastic Block Models

Yezheng Li, Hongzhe Li|arXiv (Cornell University)|Nov 30, 2018
Complex Network Analysis Techniques参考文献 37被引用 15
一句话总结

本文提出了一种两样本假设检验方法,用于判断从加权随机块模型(WSBM)生成的两个加权网络中的社区成员关系是否在统计上完全相同。通过使用奇异子空间距离(经Procrustes变换)与随机矩阵理论,作者在稠密图条件下推导出检验统计量的极限分布,证明了该检验具有正确的第一类错误控制能力,且统计功效随差异程度(以1/2阶R{\'e}nyi散度衡量)增加而提升,该方法在Enron电子邮件网络数据上得到验证。

ABSTRACT

Suppose two networks are observed for the same set of nodes, where each network is assumed to be generated from a weighted stochastic block model. This paper considers the problem of testing whether the community memberships of the two networks are the same. A test statistic based on singular subspace distance is developed. Under the weighted stochastic block models with dense graphs, the limiting distribution of the proposed test statistic is developed. Simulation results show that the test has correct empirical type 1 errors under the dense graphs. The test also behaves as expected in empirical power, showing gradual changes when the intra-block and inter-block distributions are close and achieving 1 when the two distributions are not so close, where the closeness of the two distributions is characterized by Renyi divergence of order 1/2. The Enron email networks are used to demonstrate the proposed test.

研究动机与目标

  • 开发一种统计检验方法,用于比较具有相同节点的两个加权网络的社区结构。
  • 解决加权随机块模型(WSBM)缺乏两样本推断方法的问题。
  • 在稠密图渐近条件下,建立基于奇异子空间距离的检验统计量的极限分布。
  • 在不同分布差异程度下,验证检验的实证第一类错误率与统计功效。
  • 通过真实世界Enron电子邮件网络数据,展示该方法的实用性。

提出的方法

  • 检验统计量基于两个网络邻接矩阵左奇异子空间经Procrustes变换后的差异的Frobenius范数。
  • 该方法在WSBM假设下,利用谱聚类从加权邻接矩阵中估计社区成员关系。
  • 应用随机矩阵理论与矩匹配法,在稠密图条件下推导检验统计量的极限分布。
  • 将Tang等人(2017)关于子空间距离渐近展开的结果扩展至稠密图,以计算检验统计量的均值与方差。
  • 该检验考虑了不等块大小的情况,并通过标准化处理确保在有限样本下的稳健性。
  • 通过模拟实验验证理论结果,并将其应用于Enron电子邮件网络数据集。

实验结果

研究问题

  • RQ1我们能否检验两个具有相同节点的加权网络是否具有相同的潜在社区结构?
  • RQ2在稠密图渐近条件下,两个WSBM网络之间奇异子空间距离的极限分布是什么?
  • RQ3当块内与块间边权分布之间的R{\'e}nyi散度(阶数为1/2)增加时,检验的统计功效如何变化?
  • RQ4在不同网络密度与块大小配置下,检验是否能保持正确的第一类错误率?
  • RQ5该方法能否检测到社区结构的细微变化,例如时间序列网络数据中出现的变化?

主要发现

  • 在稠密图条件下,所提出的检验保持了正确的实证第一类错误率,各类网络规模与块配置下第一类错误率均接近名义上的5%水平。
  • 随着块内与块间边权分布之间1/2阶R{\'e}nyi散度的增加,实证功效逐渐提升,当分布足够不同时,功效可达1。
  • 当K=2时,所有样本量(n=500至8000)下第一类错误率均低于6%;当K>2时,第一类错误率随K增加而上升,但仍在控制范围内,K=4、n=500时最高达91.9%。
  • 通过矩匹配与随机矩阵理论,首次推导出该检验统计量的渐近分布,这是此前文献中未见于稠密WSBM模型的创新贡献。
  • 该检验在检测社区结构差异方面表现出高统计功效,当两组分布不接近时,功效趋近于1,经模拟与Enron网络分析结果验证。
  • 该方法对不等块大小具有鲁棒性,在中等样本量下表现良好,且当K超过2时,收敛速度仅略有减缓。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。