[论文解读] Modelling sparsity, heterogeneity, reciprocity and community structure in temporal interaction data
本文提出了一种基于点过程的新型模型,利用复合完全随机测度(CCRM)联合建模时间交互数据中的稀疏性、度异质性、相互性及社区结构。通过利用CCRM将相互激发的相互性与潜在社区归属关系结合,并实现幂律度分布,该模型在四个真实世界数据集上的链接预测任务中优于现有方法。
We propose a novel class of network models for temporal dyadic interaction data. Our goal is to capture a number of important features often observed in social interactions: sparsity, degree heterogeneity, community structure and reciprocity. We propose a family of models based on self-exciting Hawkes point processes in which events depend on the history of the process. The key component is the conditional intensity function of the Hawkes Process, which captures the fact that interactions may arise as a response to past interactions (reciprocity), or due to shared interests between individuals (community structure). In order to capture the sparsity and degree heterogeneity, the base (non time dependent) part of the intensity function builds on compound random measures following Todeschini et al. (2016). We conduct experiments on a variety of real-world temporal interaction data and show that the proposed model outperforms many competing approaches for link prediction, and leads to interpretable parameters.
研究动机与目标
- 开发一种统计模型,以同时捕捉时间二元交互数据中的多个结构特征——稀疏性、度异质性、相互性与社区结构。
- 解决现有模型在稀疏、重尾网络中无法联合建模这些特征的局限性。
- 通过复合随机测度扩展先前的Hawkes过程模型,以处理幂律度分布与重叠社区结构。
- 在保持潜在参数可解释性的前提下,提升真实世界时间网络数据集上的链接预测性能。
- 提供一个统一框架,结合交换性随机测度与边交换性模型的优势,用于时间网络建模。
提出的方法
- 模型使用相互激发的Hawkes过程捕捉相互性,即个体对之间的交互会触发双向未来的交互。
- 每对个体的基强度函数通过复合完全随机测度(CCRM)建模,该测度通过伽马混合测度诱导稀疏性与重尾度分布。
- 潜在社区结构通过强度函数中的共享特征编码,其中每个节点对社区的隶属关系通过权重 $ w_{ik} $ 建模。
- 模型将非时变的CCRM组件与时变的Hawkes激发核结合,联合建模静态网络结构与动态交互模式。
- 通过两阶段MCMC算法进行推断:首先估计超参数与社区结构,然后在推断结构的条件下估计Hawkes过程参数。
- 该模型已扩展以处理重叠社区,并在后续扩展中支持非对称基强度与双线性形式。
实验结果
研究问题
- RQ1是否能够通过单一统计模型联合捕捉时间交互数据中的稀疏性、度异质性、相互性与社区结构?
- RQ2在时间设定下,引入复合完全随机测度(CCRM)在建模稀疏与重尾网络方面有何改进?
- RQ3与静态模型相比,引入相互激发(相互性)在多大程度上提升了链接预测性能?
- RQ4当显式建模度异质性时,该模型在恢复潜在社区结构方面表现如何?
- RQ5所提出的Hawkes-CCRM框架是否在多样化的真实世界时间数据集上均优于现有模型?
主要发现
- 所提出的Hawkes-CCRM模型在四个真实世界数据集(Email、College、Math、Ubuntu)上的链接预测任务中均优于对比模型。
- 该模型在链接预测中的均方根误差(RMSE)低于基线模型,包括基于IRM与基于CCRM的方法,表明其预测精度更高。
- 加入Hawkes组件后,基于IRM与基于CCRM的模型性能均得到提升,表明动态相互性显著增强了预测能力。
- 模型成功恢复了社区结构,表现为按节点最高社区隶属度分组并按社交性参数排序的邻接矩阵。
- 后验预测度分布与所有数据集中的经验度分布高度吻合,证实了模型对重尾度异质性的捕捉能力。
- 稀疏性参数 $\sigma$ 的95%后验可信区间范围为 $(-0.69, -0.50)$ 至 $(0.51, 0.57)$,表明不同数据集的网络密度存在差异,负值对应较密集网络(Email、College),正值对应较稀疏网络(Math、Ubuntu)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。