Skip to main content
QUICK REVIEW

[论文解读] FS^3: A Sampling based method for top-k Frequent Subgraph Mining

Tanay Kumar Saha, Mohammad Al Hasan|arXiv (Cornell University)|Sep 2, 2014
Data Mining Algorithms and Applications被引用 3
一句话总结

FS³ 是一种基于采样的方法,用于挖掘频繁子图,通过在固定大小的子图上使用马尔可夫链蒙特卡洛(MCMC)采样,利用评分函数优先选择频率更高的子图。它在不到1小时内高效识别出大规模图中的最频繁诱导子图(例如,pr@500 达54.2%),无需求解计算成本高昂的子图同构问题,从而在传统方法失效的地方实现了可扩展性。

ABSTRACT

Mining labeled subgraph is a popular research task in data mining because of its potential application in many different scientific domains. All the existing methods for this task explicitly or implicitly solve the subgraph isomorphism task which is computationally expensive, so they suffer from the lack of scalability problem when the graphs in the input database are large. In this work, we propose FS^3, which is a sampling based method. It mines a small collection of subgraphs that are most frequent in the probabilistic sense. FS^3 performs a Markov Chain Monte Carlo (MCMC) sampling over the space of a fixed-size subgraphs such that the potentially frequent subgraphs are sampled more often. Besides, FS^3 is equipped with an innovative queue manager. It stores the sampled subgraph in a finite queue over the course of mining in such a manner that the top-k positions in the queue contain the most frequent subgraphs. Our experiments on database of large graphs show that FS^3 is efficient, and it obtains subgraphs that are the most frequent amongst the subgraphs of a given size.

研究动机与目标

  • 解决依赖子图同构和穷举枚举的现有频繁子图挖掘(FSM)算法在大规模图上面临的可扩展性限制。
  • 开发一种方法,无需完整枚举子图空间,即可高效识别给定大小下最频繁的诱导子图。
  • 克服在大规模生物和社交网络(如蛋白质-蛋白质相互作用(PPI)网络)上使用精确FSM方法时的计算不可行性。
  • 提供一种概率性、可扩展的精确FSM替代方案,保持估计值与实际子图支持之间的高等级相关性。
  • 实现快速、近似的top-k频繁子图挖掘,适用于图分类和索引等下游任务。

提出的方法

  • 在固定大小的诱导子图空间上使用马尔可夫链蒙特卡洛(MCMC)采样,基于子图评分函数 $ s_1(G) $ 和 $ s_2(G) $ 构建目标分布,以优先选择潜在高频子图。
  • 使用有限大小的优先队列维护最常采样的top-k子图,并根据采样频率动态更新。
  • 为子图生成规范编码,以在采样和队列插入过程中高效进行同构性检查。
  • 引入基于Gelman-Rubin诊断的停止准则,通过测量多条采样链之间的杰卡德距离来检测收敛性。
  • 应用一种评分函数,基于局部邻域统计信息估计子图频率,从而减少对完整子图同构检查的依赖。
  • 通过最小化规范编码生成和队列插入的开销来优化性能,这些开销与采样时间相比可忽略不计。

实验结果

研究问题

  • RQ1基于采样的方法是否能在大规模图上实现比精确FSM算法更优的运行时间和可扩展性?
  • RQ2与均匀采样相比,使用基于 $ s_1 $ 或 $ s_2 $ 的非均匀目标分布进行MCMC采样,是否能提高top-k频繁子图恢复的精度?
  • RQ3优先队列的大小如何影响top-k子图恢复的准确性和内存使用?
  • RQ4基于收敛性的停止准则(Gelman-Rubin诊断)是否能有效判断采样是否已充分进行?
  • RQ5FS³在具有不同子图空间复杂度的多种图数据集上性能是否具有鲁棒性?

主要发现

  • 在PS数据集上,使用 $ s_2 $ 评分函数时,FS³在70分钟内实现了54.2%的pr@500,显著优于相同时间内的均匀采样(52.3% pr@500)。
  • 在PS数据集上,对于大小为8的子图,FS³在Mutagen数据集上10分钟内实现了超过90%的pr@500,表明在较小子图空间中表现优异。
  • 估计值与实际子图支持之间的肯德尔tau等级相关系数始终很高(例如,在2.0目标分布下为55.4),表明等级相关性强。
  • 运行时间几乎随子图大小 $ p $ 线性增加,采样时间主导了执行时间,队列插入开销可忽略不计。
  • 在不同 $ k $ 值(100至500)下性能保持稳定,精度和肯德尔tau值变化极小,表明对 $ k $ 具有鲁棒性。
  • Gelman-Rubin诊断显示,随着迭代进行,各采样链之间的杰卡德距离逐渐减小,证实了收敛性并验证了停止准则的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。