[论文解读] Learning Multi-Stage Sparsification for Maximum Clique Enumeration
本文提出一种多阶段学习框架,利用基于邻域的特征来剪除不可能属于任何最大团的顶点,从而在最大团枚举中实现显著加速。在密集图上实现最高53倍的加速(剪除约30%的顶点),在稀疏真实世界图上实现超过99%的剪除率,且无需在运行时估计团大小。
We propose a multi-stage learning approach for pruning the search space of maximum clique enumeration, a fundamental computationally difficult problem arising in various network analysis tasks. In each stage, our approach learns the characteristics of vertices in terms of various neighborhood features and leverage them to prune the set of vertices that are likely not contained in any maximum clique. Furthermore, we demonstrate that our approach is domain independent -- the same small set of features works well on graph instances from different domain. Compared to the state-of-the-art heuristics and preprocessing strategies, the advantages of our approach are that (i) it does not require any estimate on the maximum clique size at runtime and (ii) we demonstrate it to be effective also for dense graphs. In particular, for dense graphs, we typically prune around 30 \% of the vertices resulting in speedups of up to 53 times for state-of-the-art solvers while generally preserving the size of the maximum clique (though some maximum cliques may be lost). For large real-world sparse graphs, we routinely prune over 99 \% of the vertices resulting in several tenfold speedups at best, typically with no impact on solution quality.
研究动机与目标
- 解决在最大团枚举(MCE)中高效剪除搜索空间的挑战,这是网络分析中的一个基本NP难问题。
- 克服以往预处理方法依赖团大小估计或在密集图上失效的局限性。
- 开发一种领域无关、可扩展的方法,通过学习到的顶点和边特征在多种图类型上实现泛化。
- 在无需运行时估计最大团大小的前提下,实现在稀疏图和密集图中的有效剪除。
- 通过使用多阶段学习流水线自适应调整特征重要性,改进现有启发式剪除方法。
提出的方法
- 应用梯度提升树模型,基于10个基于邻域的特征(包括局部染色密度、特征向量中心性及基于度数的统计量)学习顶点剪除决策。
- 采用多阶段流水线,每个阶段重新计算特征并应用训练好的分类器,以移除不可能属于任何最大团的顶点。
- 引入基于边的分类,使用类似特征(如邻域交集、度数耦合)在后续阶段进一步优化剪除效果。
- 利用精确的ω-Oracle提供真实的最大团大小,确保剪除过程中不损失解的质量。
- 设计动态停止策略以避免过度剪除,可在剪除收益下降或解质量下降时选择停止。
- 通过重用邻居未改变时的计算值,并探索动态图算法,优化特征计算,降低重新计算成本。
实验结果
研究问题
- RQ1多阶段学习方法是否能在无需团大小估计的前提下,有效实现对稀疏图和密集图的剪除?
- RQ2与最先进的预处理技术相比,所提方法在剪除率和加速比方面的表现如何?
- RQ3单套特征在不同图领域(如社交、生物、合成图)中能多大程度上实现泛化,而无需重新训练?
- RQ4在稀疏图与密集图中,哪些特征对顶点剪除最具预测力,其重要性有何差异?
- RQ5基于边的分类是否能进一步提升剪除精度和加速比,特别是在顶点剪除已显著减小图规模的后期阶段?
主要发现
- 该方法通过剪除约30%的顶点,在密集图上实现最高53倍加速,显著优于k-core-based方法。
- 在socfb-Texas84和bio-WormNet-v3等大型真实世界稀疏图上,该方法可稳定剪除超过99%的顶点,且不损失解的质量。
- 该模型在不同领域间具有良好的泛化能力:无需为不同图类型重新训练,即可保持高剪除精度(稀疏图F1得分0.96,密集图F1得分0.76)。
- 特征重要性分析显示,在稀疏图中,局部染色密度(F10)最为重要(重要性0.22),而在密集图中,邻居度数的χ²平均值(F7)占主导地位(重要性0.23)。
- 基于边的分类达到83%的准确率,略高于顶点分类,但因需执行邻域交集操作,特征计算速度较慢。
- 该方法保留了所有最大团,因其使用来自ω-Oracle的精确最大团大小,确保剪除过程保守且正确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。