Skip to main content
QUICK REVIEW

[论文解读] Community detection for interaction networks

Harry Crane, Walter Dempsey|arXiv (Cornell University)|Sep 30, 2015
Complex Network Analysis Techniques参考文献 32被引用 6
一句话总结

本文提出直接对交互次数进行建模,而非将其阈值化为二值网络,证明了诸如泊松分布和二项式随机块模型等简单统计模型在社区检测中优于 Newman–Girvan 模块度。研究表明,阈值化会引入模块度方法的不稳定性,而直接建模则能更准确、更稳健地恢复已知的社区结构(如大法官索特尔的意识形态转变)随时间的变化。

ABSTRACT

In many applications, it is common practice to obtain a network from interaction counts by thresholding each pairwise count at a prescribed value. Our analysis calls attention to the dependence of certain methods, notably Newman--Girvan modularity, on the choice of threshold. Essentially, the threshold either separates the network into clusters automatically, making the algorithm's job trivial, or erases all structure in the data, rendering clustering impossible. By fitting the original interaction counts as given, we show that minor modifications to classical statistical methods outperform the prevailing approaches for community detection from interaction datasets. We also introduce a new hidden Markov model for inferring community structures that vary over time. We demonstrate each of these features on three real datasets: the karate club dataset, voting data from the U.S.\ Senate (2001--2003), and temporal voting data for the U.S. Supreme Court (1990--2004).

研究动机与目标

  • 挑战将交互次数阈值化为二值网络以进行社区检测的常见做法。
  • 揭示 Newman–Girvan 模块度对阈值选择的敏感性,这种敏感性会损害所检测社区的可靠性。
  • 证明将经典统计模型直接应用于交互次数,其性能优于当前主流的基于网络的算法。
  • 为检测交互数据中随时间变化的社区结构(特别是纵向立法投票网络)开发一个隐马尔可夫模型。
  • 提供一种有原则的替代方案,以避免阈值化,从而保留数据的丰富性并提高推断的稳定性。

提出的方法

  • 使用两参数泊松分布对交互次数进行建模,避免二值化投影,保留基于计数的信息。
  • 将二项式随机块模型应用于交互数据,实现在无需阈值化的情况下推断社区结构。
  • 引入一个带有 Ewens 剪切-粘贴链的隐马尔可夫模型,以建模立法投票网络中社区成员身份的时序演化。
  • 使用最大似然估计或贝叶斯推断拟合模型,利用标准统计工具而非算法化的网络聚类方法。
  • 将结果与在三个真实数据集(空手道俱乐部、美国参议院、美国最高法院)上对阈值化网络应用 Newman–Girvan 模块度的结果进行比较。
  • 使用模型拟合度和聚类准确率评估性能,并与已知的真实社区结构进行验证。

实验结果

研究问题

  • RQ1在网络投影中选择不同阈值如何影响使用 Newman–Girvan 模块度进行社区检测的可靠性?
  • RQ2将经典统计模型直接应用于交互次数,是否能在社区检测中优于基于阈值的网络方法?
  • RQ3如何在交互网络中有效建模随时间演变的社区结构?
  • RQ4在现实世界数据集中,忽略交互次数数据在多大程度上会降低社区检测的准确性?
  • RQ5带有社区状态转移随机过程的隐马尔可夫模型,能否检测到美国最高法院投票行为中已知的意识形态转变?

主要发现

  • Newman–Girvan 模块度对阈值选择极为敏感,在所有数据集中均无单一阈值能可靠地恢复真实社区结构。
  • 对交互次数使用简单的两参数泊松模型可精确恢复空手道俱乐部数据集中已知的社区结构,而具有 36 个参数的度校正随机块模型却未能正确分配一个人。
  • 结合隐马尔可夫模型的二项式随机块模型正确检测到美国最高法院大法官戴维·索特尔在 1992 年至 1993 年间从保守派向自由派的意识形态转变。
  • 对最高法院数据集每个立法任期独立应用 Newman–Girvan 模块度,结果不一致,最优阈值随时间发生显著变化。
  • 直接对交互次数进行建模可避免由阈值化引入的不稳定性,从而在所有三个数据集中实现更稳健、更准确的社区检测。
  • 所提出的方法在参数更少、可解释性更强的前提下,性能优于标准的基于网络的算法,尤其在纵向分析场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。