Skip to main content
QUICK REVIEW

[论文解读] Predicting Sequences of Traversed Nodes in Graphs using Network Models with Multiple Higher Orders

Christoph Gote, Giona Casiraghi|arXiv (Cornell University)|Jul 13, 2020
Complex Network Analysis Techniques参考文献 41被引用 4
一句话总结

该论文提出MOGen,一种新颖的方法,通过将多个高阶马尔可夫模型整合到统一的生成框架中,以预测图中遍历节点的序列。该方法在六组实证数据集上均优于最先进算法,在下一元素预测和全路径预测方面表现优异,并通过基于信息的模型选择算法自动确定最优模型阶数,无需超参数调优。

ABSTRACT

We propose a novel sequence prediction method for sequential data capturing node traversals in graphs. Our method builds on a statistical modelling framework that combines multiple higher-order network models into a single multi-order model. We develop a technique to fit such multi-order models in empirical sequential data and to select the optimal maximum order. Our framework facilitates both next-element and full sequence prediction given a sequence-prefix of any length. We evaluate our model based on six empirical data sets containing sequences from website navigation as well as public transport systems. The results show that our method out-performs state-of-the-art algorithms for next-element prediction. We further demonstrate the accuracy of our method during out-of-sample sequence prediction and validate that our method can scale to data sets with millions of sequences.

研究动机与目标

  • 解决现有序列预测方法在处理网络拓扑约束和可变长度路径时的局限性。
  • 开发一种统一的生成模型,捕捉节点序列中的高阶依赖关系,同时尊重底层图结构。
  • 提出一种基于信息论的模型选择算法,自动确定序列模式的最优最大阶数,无需人工调参。
  • 通过单一训练模型同时支持下一元素预测和全路径预测,适用于可变长度序列。

提出的方法

  • 该方法将多个阶数的马尔可夫链整合为单一多阶生成模型,以捕捉受底层图拓扑约束的序列模式。
  • 通过多层网络表示导出的块邻接矩阵和转移矩阵形式化模型,实现路径似然的高效计算。
  • 路径似然在多个路径上并行计算,显著加速训练过程,并支持大规模数据集的可扩展性。
  • 采用基于AIC的信息模型选择程序,选择最优最大阶数K,平衡模型拟合度与复杂度。
  • 显式建模路径的起始节点和结束节点,以及路径长度分布,提升预测准确性。
  • 采用并行化实现,使该方法可扩展至包含数百万条可变长度序列的数据集。

实验结果

研究问题

  • RQ1统一的多阶模型是否能在网络中遍历节点序列的下一节点预测任务中优于现有方法?
  • RQ2如何在尊重底层图拓扑约束的前提下,有效建模序列节点遍历中的高阶依赖关系?
  • RQ3基于信息论的模型选择方法是否能自动识别最优最大阶数K,而无需人工调整超参数?
  • RQ4所提出的模型在泛化能力方面表现如何,能否成功实现对样本外路径预测,包括完整的可变长度路径序列?
  • RQ5该模型在大规模真实世界数据集上的训练时间与内存使用量方面具有怎样的可扩展性?

主要发现

  • MOGen在六个实证数据集(包括网站浏览和公共交通系统)的下一元素预测任务中显著优于最先进算法。
  • 基于AIC的模型选择算法成功识别出最优最大阶数K,所生成模型泛化性能良好,无过拟合或欠拟合现象。
  • MOGen所选的所有模型大小均低于1 MB,表明即使在建模复杂序列模式时,仍具有高度紧凑性和高效性。
  • 训练时间与处理核心数量近乎线性增长,表明在大规模数据集上具有极强的并行化效率。
  • 该方法成功实现了对样本外完整可变长度路径的预测,例如真实交通网络中的乘客行程路径。
  • 模型大小随最大阶数K呈超线性增长,但在稀疏连接网络(如TUBE数据集)中增长受到最强约束。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。