Skip to main content
QUICK REVIEW

[论文解读] Exact integrated completed likelihood maximisation in a stochastic block transition model for dynamic networks

Riccardo Rastelli|arXiv (Cornell University)|Oct 10, 2017
Bayesian Methods and Mixture Models参考文献 3被引用 5
一句话总结

本文提出了一种贝叶斯贪婪优化方法,用于通过最大化精确的完整集成似然(ICL)来拟合随机块转移模型(SBTMs)于动态网络,从而在无需网格搜索的情况下自动选择最优潜群数量。该方法能有效捕捉跨时间的边持久性,可扩展至大规模网络,并自然地建模节点非活跃状态,在捕捉时间动态方面优于静态模型。

ABSTRACT

The latent stochastic block model is a flexible and widely used statistical model for the analysis of network data. Extensions of this model to a dynamic context often fail to capture the persistence of edges in contiguous network snapshots. The recently introduced stochastic block transition model addresses precisely this issue, by modelling the probabilities of creating a new edge and of maintaining an edge over time. Using a model-based clustering approach, this paper illustrates a methodology to fit stochastic block transition models under a Bayesian framework. The method relies on a greedy optimisation procedure to maximise the exact integrated completed likelihood. The computational efficiency of the algorithm used makes the methodology scalable and appropriate for the analysis of large network datasets. Crucially, the optimal number of latent groups is automatically selected at no additional computing cost. The efficacy of the method is demonstrated through applications to both artificial and real datasets.

研究动机与目标

  • 为解决现有动态随机块模型在捕捉连续网络快照之间边持久性方面的局限性。
  • 开发一种计算高效的推断过程,同时估计动态网络中的潜群数量与节点聚类归属。
  • 不仅通过潜群演化,还通过直接的边转移概率(创建/维持)来建模时间依赖性。
  • 在无需额外计算成本的情况下实现最优分组数量的自动选择,避免对模型维度进行网格搜索。
  • 在合成数据和真实世界动态网络数据(包括Reality Mining数据集)上展示该方法的可扩展性与准确性。

提出的方法

  • 该方法采用具有非信息先验的贝叶斯层次生成过程,以建模节点非活跃状态及随时间的边转移。
  • 采用贪婪优化算法以最大化精确的完整集成似然(ICL),该ICL在模型拟合与复杂度之间实现平衡。
  • 精确计算ICL准则,避免使用变分近似,作为分组分配与参数估计的目标函数。
  • 算法通过迭代重分配节点至各组以提升ICL,收敛性通过似然值增加进行监控。
  • 该框架通过允许非活跃节点为暂时性或永久性,自然地处理非活跃节点,从而在长时序网络中降低计算负载。
  • 实现代码使用C++编写,并集成至R包GreedySBTM,可在CRAN公开获取。

实验结果

研究问题

  • RQ1一种显式捕捉时间上边持久性的模型,是否能在动态网络聚类中优于标准的动态SBM?
  • RQ2能否以贪婪方式高效优化精确的完整集成似然,以同时估计分组数量与节点分配?
  • RQ3所提出的方法是否能自动选择最优潜群数量,而无需预先指定或进行网格搜索?
  • RQ4该方法在具有大量时间点与节点的大规模动态网络数据集上扩展性如何?
  • RQ5与静态模型或非持久性动态模型相比,边持久性建模在多大程度上提升了聚类准确性?

主要发现

  • 在模拟研究中,该方法成功识别出真实的潜群数量,且自动选择过程在无额外计算成本下完成。
  • 该模型有效捕捉了边持久性,估计转移矩阵的高对角线值表明边状态在时间上具有强稳定性。
  • 在Reality Mining数据集中,该方法揭示了明显的时间模式,包括类似枢纽的群组与孤立社区,且存在明确的非活跃阶段。
  • 该算法在大规模网络上表现出良好的可扩展性,计算效率使分析包含大量时间点与节点的数据集成为可能。
  • 模拟结果表明,忽略边持久性的模型往往无法恢复真实的生成机制,导致聚类解释在定性上不同且准确性更低。
  • 该方法在捕捉真实网络动态方面优于非持久性动态模型,尤其在具有周期性非活跃期的数据集中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。