[论文解读] Modularity based community detection in heterogeneous networks
本文提出了一种基于模块度的异质网络社区检测框架,将社区数量视为未知且灵活的。该方法通过考虑不同节点类型和边类型的零模型,将模块度扩展至异质网络,并采用类似Louvain的优化方法以最大化模块度,在随机块模型下表现出一致性,且在真实数据集(如DBLP和MovieLens)上性能强劲。
Heterogeneous networks are networks consisting of different types of nodes and multiple types of edges linking such nodes. While community detection has been extensively developed as a useful technique for analyzing networks that contain only one type of nodes, very few community detection techniques have been developed for heterogeneous networks. In this paper, we propose a modularity based community detection framework for heterogeneous networks. Unlike existing methods, the proposed approach has the flexibility to treat the number of communities as an unknown quantity. We describe a Louvain type maximization method for finding the community structure that maximizes the modularity function. Our simulation results show the advantages of the proposed method over existing methods. Moreover, the proposed modularity function is shown to be consistent under a heterogeneous stochastic blockmodel framework. Analyses of the DBLP four-area dataset and a MovieLens dataset demonstrate the usefulness of the proposed method.
研究动机与目标
- 解决缺乏针对具有多种节点类型和边类型的异质网络的社区检测方法的问题。
- 克服现有方法需预先指定社区数量或忽略跨类型边的局限性。
- 开发一种灵活的、基于模块度的框架,可在不预先假设社区数量的情况下识别社区。
- 确保所提出的模块度函数在异质随机块模型框架下的理论一致性。
- 通过在真实世界数据集(包括DBLP和MovieLens)上的应用,展示其实际效用。
提出的方法
- 定义一种异质网络模块度函数,综合考虑多种节点类型之间的同类型与异类型边。
- 构建一个零模型,保留无社区结构假设下的期望边分布,同时考虑节点类型特有的度分布。
- 将模块度表述为同类型与异类型边对的贡献总和,并根据零模型下的期望边数进行调整。
- 实现一种类似Louvain的优化算法,通过迭代重分配节点到社区来最大化模块度函数。
- 使用社区分配向量和转移矩阵来建模节点在社区间的隶属关系及社区间边的概率。
- 通过证明在随机块模型框架下,模块度最大化的估计结果会收敛至真实社区结构,确保理论一致性。
实验结果
研究问题
- RQ1基于模块度的方法能否有效检测具有多种节点类型和边类型的异质网络中的社区?
- RQ2与现有社区检测技术相比,所提出方法在真实异质网络上的表现如何?
- RQ3所提出的模块度函数在异质随机块模型下是否能一致地恢复真实社区结构?
- RQ4该方法能否自动确定社区数量,而无需将其作为输入?
- RQ5包含跨类型边(如用户-事件链接)对异质网络中社区检测准确率有何影响?
主要发现
- 所提出的模块度函数在异质随机块模型下具有一致性,即随着网络规模增大,估计的社区结构会收敛至真实结构。
- 类似Louvain的优化算法成功最大化模块度函数,并在无需预先指定社区数量的情况下识别出社区结构。
- 仿真结果表明,所提出方法在检测异质网络社区方面优于现有方法。
- 在DBLP四领域数据集上,该方法成功识别出研究人员及其研究领域的社区,揭示了基于合作模式的有意义分组。
- 在MovieLens数据集中,该方法检测出用户与电影的社区,用户社区表现出对特定电影类型的显著偏好。
- 该方法表现出强鲁棒性与可扩展性,在处理大规模网络时比先前工作中使用的谱聚类方法更高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。