Skip to main content
QUICK REVIEW

[论文解读] Infinite Multiple Membership Relational Modeling for Complex Networks

Morten Mørup, Mikkel N. Schmidt|arXiv (Cornell University)|Jan 26, 2011
Complex Network Analysis Techniques参考文献 11被引用 7
一句话总结

本文提出了一种无限多重成员关系模型(IMRM),通过非参数贝叶斯框架在复杂网络中显式建模顶点属于多个潜在社区的情况,其计算复杂度在边数上呈线性,而非顶点数。与单重成员关系模型相比,该方法在链接预测方面表现更优,且能生成更紧凑的潜在结构表示。实证结果表明,在蛋白质相互作用网络和词共现网络等真实世界网络中,性能显著提升。

ABSTRACT

Learning latent structure in complex networks has become an important problem fueled by many types of networked data originating from practically all fields of science. In this paper, we propose a new non-parametric Bayesian multiple-membership latent feature model for networks. Contrary to existing multiple-membership models that scale quadratically in the number of vertices the proposed model scales linearly in the number of links admitting multiple-membership analysis in large scale networks. We demonstrate a connection between the single membership relational model and multiple membership models and show on "real" size benchmark network data that accounting for multiple memberships improves the learning of latent structure as measured by link prediction while explicitly accounting for multiple membership result in a more compact representation of the latent structure of networks.

研究动机与目标

  • 解决单重成员关系模型在捕捉顶点属于多个社区的复杂网络结构方面的局限性。
  • 开发一种可扩展的生成模型,显式考虑多重成员关系,且在顶点数量上无二次方复杂度。
  • 通过在真实世界网络中建模重叠社区成员关系,提升链接预测的准确性。
  • 与单重成员关系模型相比,提供更紧凑且可解释性更强的潜在网络结构表示。
  • 将非参数贝叶斯建模扩展至多重成员关系场景,并实现线性计算复杂度。

提出的方法

  • 提出一种非参数贝叶斯潜在特征模型,其中每个顶点可属于多个潜在社区,以二值特征向量表示。
  • 使用中国餐馆过程(CRP)先验,允许存在无限多个潜在社区,从而实现非参数推断。
  • 将链接概率建模为顶点间共享特征的函数,计算复杂度在边数上呈线性。
  • 采用折叠吉布斯采样策略进行后验推断,高效采样特征分配和链接概率参数。
  • 提出一种新型参数化方法,显式建模多重成员关系,与无限关系模型(IRM)等模型中通过单重成员关系组件隐式实现多重成员关系的方法形成对比。
  • 将模型推广至无向、有向和二分图网络,并支持集成辅助信息和顶点属性。

实验结果

研究问题

  • RQ1在网络结构中显式建模多重成员关系是否能带来优于单重成员关系模型的链接预测性能?
  • RQ2所提出的模型是否在边数上实现线性可扩展性,从而适用于大规模网络?
  • RQ3与单重成员关系模型相比,所学习的潜在结构表示在紧凑性方面表现如何?
  • RQ4在预测性能和结构紧凑性两方面,该模型相较于无限关系模型(IRM)的优越程度如何?
  • RQ5该模型能否有效捕捉真实世界网络中具有异质链接密度的重叠社区结构?

主要发现

  • 与单重成员关系模型相比,IMRM在所有测试网络中的链接预测AUC均有显著提升,尤其在FreeAssoc和Reuters911网络中提升最高达15%。
  • IMRM提取的组件数量显著少于IRM——例如,在Yeast网络中分别为15.4和24.0,表明潜在结构表示更紧凑。
  • 平均而言,IMRM在所有网络中将组件数量减少30%,在不损失预测性能的前提下实现了更优的结构紧凑性。
  • IMRM的计算成本与IRM相当,2500次迭代的平均CPU时间处于同一数量级(例如,Yeast网络中分别为1.7小时和2.3小时)。
  • 尽管显式建模多重成员关系,IMRM在链接预测性能上与IRM相当,表明显式建模比隐式近似更高效。
  • 该模型成功捕捉了多种网络中的重叠社区结构,包括蛋白质相互作用网络、电网网络和词共现网络,并在链接预测方面持续取得改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。