Skip to main content
QUICK REVIEW

[论文解读] Supervised and Extended Restart in Random Walks for Ranking and Link Prediction in Networks

Woojeong Jin, Jinhong Jung|arXiv (Cornell University)|Oct 18, 2017
Complex Network Analysis Techniques参考文献 24被引用 3
一句话总结

本文提出随机游走扩展重启(RWER),一种个性化相关性评分方法,通过为每个节点分配独特的重启概率,增强在排序和链接预测中的表达能力。该文引入SuRe,一种监督学习算法,可从数据中自动学习最优重启概率,在链接预测任务中实现比最佳竞争对手高至15.8%的MAP。

ABSTRACT

Given a real-world graph, how can we measure relevance scores for ranking and link prediction? Random walk with restart (RWR) provides an excellent measure for this and has been applied to various applications such as friend recommendation, community detection, anomaly detection, etc. However, RWR suffers from two problems: 1) using the same restart probability for all the nodes limits the expressiveness of random walk, and 2) the restart probability needs to be manually chosen for each application without theoretical justification. We have two main contributions in this paper. First, we propose Random Walk with Extended Restart (RWER), a random walk based measure which improves the expressiveness of random walks by using a distinct restart probability for each node. The improved expressiveness leads to superior accuracy for ranking and link prediction. Second, we propose SuRe (Supervised Restart for RWER), an algorithm for learning the restart probabilities of RWER from a given graph. SuRe eliminates the need to heuristically and manually select the restart parameter for RWER. Extensive experiments show that our proposed method provides the best performance for ranking and link prediction tasks, improving the MAP (Mean Average Precision) by up to 15.8% on the best competitor.

研究动机与目标

  • 解决传统随机游走重启(RWR)中固定重启概率的局限性,该局限限制了衡量节点相关性的表达能力。
  • 通过开发数据驱动的学习方法,克服RWR中需要启发式、手动选择重启概率的问题。
  • 通过使查询节点能够通过不同的重启概率表达偏好,提升排序与链接预测的准确性。
  • 设计一种可扩展且鲁棒的学习算法,在保持高性能的同时避免过拟合,适用于真实世界图结构。

提出的方法

  • 提出RWER,作为RWR的泛化形式,其中每个节点具有唯一的重启概率,从而根据节点特定偏好实现对随机游走行为的更精细控制。
  • 将相关性评分计算建模为包含节点特定重启概率的个性化转移矩阵的线性方程组。
  • 引入SuRe,一种监督学习框架,通过基于真实链接或排名的可微目标函数优化重启概率。
  • 在SuRe中引入源向量作为正则化项,以防止过拟合并提升泛化能力,尤其在低数据场景下表现更优。
  • 采用小批量采样进行随机优化,使SuRe可扩展至大规模图结构,确保时间复杂度接近与边数线性相关。
  • 通过学习能最大化下游任务预测准确率的重启概率,充分发挥个性化随机游走的优势。

实验结果

研究问题

  • RQ1为每个节点分配不同的重启概率是否能提升基于随机游走的相关性评分在图中的表达能力与准确性?
  • RQ2如何在不修改图结构的前提下,从数据中自动学习重启概率,以超越启发式或固定参数的方法?
  • RQ3所提出的SuRe方法是否能在多种图类型和任务(如链接预测与节点排序)中实现良好泛化?
  • RQ4SuRe中源向量正则化对模型稳定性与泛化性能有何影响?
  • RQ5SuRe在大规模网络上的可扩展性与现有基于学习的方法及传统RWR方法相比如何?

主要发现

  • 在链接预测任务中,SuRe相较于最佳现有方法,MAP最高提升15.8%。
  • 在最佳竞争对手基础上,SuRe将Precision@20提升最高达10.1%,表明其在top-k排序中表现更优。
  • 在SuRe中引入源向量显著提升了性能并减少了过拟合,尤其在低数据场景下效果明显。
  • SuRe的扩展性接近与边数线性相关,斜率为0.76,相较于其他基于学习的方法(如SRW与QUINT)在效率方面表现更优。
  • 使用学习到的重启概率的RWER在所有评估数据集与任务中,持续优于标准RWR及其他监督方法。
  • 该方法对参数选择具有鲁棒性,并在不同数据集(包括Polblogs、HepTh与Wikipedia)上表现出稳定性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。