[论文解读] GLSearch: Maximum Common Subgraph Detection via Learning to Search
GLSearch 提出了一种基于图神经网络(GNN)的深度强化学习框架,用以替代分支定界搜索中用于最大公共子图(MCS)检测的启发式节点选择策略。通过使用GNN增强的深度Q网络(DQN)学习最优搜索策略,GLSearch 在相同计算预算下显著优于当前最先进求解器,尤其在大规模和真实图上表现更优。
Detecting the Maximum Common Subgraph (MCS) between two input graphs is fundamental for applications in drug synthesis, malware detection, cloud computing, etc. However, MCS computation is NP-hard, and state-of-the-art MCS solvers rely on heuristic search algorithms which in practice cannot find good solution for large graph pairs given a limited computation budget. We propose GLSearch, a Graph Neural Network (GNN) based learning to search model. Our model is built upon the branch and bound algorithm, which selects one pair of nodes from the two input graphs to expand at a time. Instead of using heuristics, we propose a novel GNN-based Deep Q-Network (DQN) to select the node pair, allowing the search process faster and more adaptive. To further enhance the training of DQN, we leverage the search process to provide supervision in a pre-training stage and guide our agent during an imitation learning stage. Experiments on synthetic and real-world large graph pairs demonstrate that our model learns a search strategy that is able to detect significantly larger common subgraphs given the same computation budget. Our GLSearch can be potentially extended to solve many other combinatorial problems with constraints on graphs.
研究动机与目标
- 解决在图相似性分析中一个基础但为 NP-难问题的两图最大公共子图(MCS)检测挑战。
- 克服基于启发式的分支定界求解器的局限性,后者通常在实际计算预算下无法找到高质量的 MCS 解。
- 开发一种可学习的搜索策略,能够根据图的结构和拓扑自适应调整,从而提升搜索效率和解的质量。
- 通过在训练过程中引入自监督和模仿学习,减少对昂贵的预计算 MCS 标签的依赖。
- 实现在大规模真实图(包括百万节点图)上的可扩展 MCS 检测,而传统精确求解器因指数级复杂度而不可行。
提出的方法
- 将 MCS 检测建模为分支定界框架内的序列决策问题,每一步选择一对节点进行扩展。
- 引入基于 GNN 的深度 Q 网络(DQN),以替代手工设计的启发式方法进行节点对选择,从而捕捉结构和邻域特征。
- 重构 DQN 以在节点对嵌入上运行,使智能体能够评估每次选择对同构性和子图大小的长期影响。
- 采用两阶段训练流程:首先使用搜索轨迹中的监督信号进行预训练,随后通过模仿学习优化策略。
- 利用图神经网络编码候选节点对周围的 k-跳邻域结构,提升表示质量。
- 利用搜索过程本身生成监督信号,实现端到端训练,推理阶段无需依赖真实 MCS 标签。
实验结果
研究问题
- RQ1在固定计算预算下,学习得到的搜索策略是否能优于手工设计的启发式方法,以发现更大的公共子图?
- RQ2GNN 增强的 DQN 模型在 MCS 检测中,对多样化图类型(如化学图、道路网络、电路图、社交网络)的泛化能力如何?
- RQ3预训练与模仿学习的结合在不依赖标注 MCS 实例的情况下,对提升 DQN 策略性能的有效性如何?
- RQ4所学习的策略是否能识别出‘关键’节点(如高阶或结构中心节点),这些节点显著影响 MCS 大小和同构性?
- RQ5该模型在大规模图(如百万节点图)上是否能有效扩展,而传统求解器因指数复杂度而失效?
主要发现
- 在合成图对和真实图对上,GLSearch 检测到的诱导公共子图显著大于当前最先进求解器(如 McSp),尤其在计算预算紧张时表现更优。
- 在 Nci109 数据集上,GLSearch 的平均 MCS 大小小于 McSp,可视化结果表明其子图更完整且连通性更强。
- 在道路网络图(Road)中,GLSearch 通过优先选择低度节点,更符合真实 MCS 的链状结构,因此优于 McSp。
- 在电路图(Circ)中,GLSearch 正确匹配了三个高阶节点,而 McSp 因错误的节点对评分而未能匹配,导致同构性丢失。
- GLSearch 所学习的策略能够识别结构关键节点并优先处理,从而更快收敛到更大规模的 MCS 解。
- 消融实验证明,预训练和模仿学习两个阶段均对实现高性能至关重要,且基于 GNN 的 DQN 显著优于简单模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。