[论文解读] Efficient SimRank Computation via Linearization
本文提出了一种新颖的线性化技术,用于高效计算 SimRank,将递归的 SimRank 问题转化为可通过迭代方法求解的线性系统。通过利用高斯-索尔茨韦尔松弛法和随机阈值化技术,该方法加速了单对、单源和全对 SimRank 的计算,在 web-Google 和 soc-Epinions1 等大规模图上,运行时间最多减少 10 倍,内存使用量最多减少 50%。
SimRank, proposed by Jeh and Widom, provides a good similarity measure that has been successfully used in numerous applications. While there are many algorithms proposed for computing SimRank, their computational costs are very high. In this paper, we propose a new computational technique, "SimRank linearization," for computing SimRank, which converts the SimRank problem to a linear equation problem. By using this technique, we can solve many SimRank problems, such as single-pair compuation, single-source computation, all-pairs computation, top k searching, and similarity join problems, efficiently.
研究动机与目标
- 解决传统 SimRank 计算在大规模图上计算成本过高的问题。
- 支持各种查询类型(包括单对、单源、全对、top-k 和相似性连接)的 SimRank 高效计算。
- 开发一种适用于具有数十亿条边的真实世界图的可扩展且高精度的算法。
- 通过新颖的优化技术(如随机阈值化和自适应蒙特卡洛采样)降低内存消耗和执行时间。
提出的方法
- 通过利用其矩阵表示,将递归的 SimRank 公式转化为线性系统。
- 应用高斯-索尔茨韦尔松弛法,以降低计算开销的方式迭代求解线性系统。
- 引入随机阈值化技术,动态剪枝低影响更新,从而在不牺牲精度的前提下减少内存使用。
- 在验证阶段使用自适应蒙特卡洛采样,以最小化候选对的非必要计算。
- 利用 SimRank 的平方图解释,将其建模为标签传播或随机游走过程。
- 结合数学分析与算法优化,确保在参数调优下实现收敛性和精度。
实验结果
研究问题
- RQ1SimRank 计算能否被重新表述为线性系统,以实现更快、更具可扩展性的解决方案?
- RQ2高斯-索尔茨韦尔松弛法和随机阈值化技术在减少大规模图上的时间和内存开销方面有多有效?
- RQ3自适应蒙特卡洛采样在验证 SimRank 分数时,能在多大程度上提高效率?
- RQ4在真实世界网络中,SimRank > 0.001 的相似对数量是否如先前推测的那样服从幂律分布?
- RQ5在大规模数据集上,所提出的方法与现有 SimRank 算法相比,在性能和精度方面表现如何?
主要发现
- 与先前方法相比,该算法在 web-Google 和 soc-Epinions1 等大规模图上,运行时间最多减少 10 倍,内存使用量最多减少 50%。
- 在高斯-索尔茨韦尔松弛法中使用 γ ≥ 0.9 可提高精度,但会使计算时间增加 5 倍,内存使用量增加 10 倍,表明 γ = 0 对可扩展部署已足够。
- 在某些图上,随机阈值化可将内存使用量减少最多 50%,且 β = 100 的结果与 β = ∞ 几乎完全相同。
- 自适应蒙特卡洛采样可将平均计算成本减少约 1/3,因为约 1/3 的候选对需要超过 1,000 次采样。
- 在所有测试数据集中,SimRank > 0.001 的相似对数量均服从幂律分布,证实了 Cai 等人关于更大网络的猜想。
- 该方法可有效扩展至包含超过一千万个顶点和数亿条边的图,如 web-Google(1100 万个顶点,151GB 内存)和 cit-patent(20.9 万个顶点,3.6GB)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。