[论文解读] Controlling Graph Dynamics with Reinforcement Learning and Graph Neural Networks
本文提出了一种基于图神经网络(GNNs)的强化学习(RL)框架,用于在部分可观测条件下控制时间图上的动态过程,例如流行病传播或影响力最大化。该方法采用双流GNN架构,分别建模局部动态和长程信息传播,即使在存在噪声和不完整观测的情况下,也能有效实现节点干预排序,并在流行病控制和影响力最大化任务中达到最先进性能。
We consider the problem of controlling a partially-observed dynamic process on a graph by a limited number of interventions. This problem naturally arises in contexts such as scheduling virus tests to curb an epidemic; targeted marketing in order to promote a product; and manually inspecting posts to detect fake news spreading on social networks. We formulate this setup as a sequential decision problem over a temporal graph process. In face of an exponential state space, combinatorial action space and partial observability, we design a novel tractable scheme to control dynamical processes on temporal graphs. We successfully apply our approach to two popular problems that fall into our framework: prioritizing which nodes should be tested in order to curb the spread of an epidemic, and influence maximization on a graph.
研究动机与目标
- 解决在部分可观测和组合动作空间下,对图上扩散过程进行有限干预的挑战。
- 建模通过时间戳交互随时间演化的节点状态的时序图动态。
- 设计一种可扩展且可微分的框架,基于预测的下游影响对节点进行干预排序。
- 处理节点状态中的不确定性(例如潜伏感染或暴露状态),并实现网络中信念更新的传播。
- 在大规模图干预问题中,提升启发式方法和蒙特卡洛基线在可扩展性和性能方面的表现。
提出的方法
- 将问题形式化为具有时间戳边的时序图上的部分可观测马尔可夫决策过程(POMDP)。
- 采用双流GNN架构:一个用于建模局部动态,另一个用于长程信息传播。
- 使用演员-评论家强化学习算法,学习最大化预期影响力或最小化感染传播的干预策略。
- 从观测到的交互和节点状态变化构建多图,以表示时序依赖性。
- 结合动态规划计算信念更新,考虑传播延迟和潜伏状态。
- 在GNN消息传递过程中稳定邻居间的信息聚合,以提升训练稳定性。
实验结果
研究问题
- RQ1当节点状态仅部分可观测且系统随时间演化时,如何有效控制图上的动态过程?
- RQ2在最小化流行病传播或最大化影响力的目标下,如何选择一组少量节点进行干预以实现最优策略?
- RQ3当仅有局部观测时,如何对节点状态信念中的长程依赖关系进行建模?
- RQ4基于GNN的深度强化学习框架是否能在可扩展性和性能上超越启发式方法和蒙特卡洛基线?
- RQ5在存在噪声、延迟和部分观测的情况下,如何稳定基于GNN的策略训练?
主要发现
- 所提方法在流行病控制和影响力最大化基准测试中均达到最先进性能,优于启发式和蒙特卡洛基线。
- 双流GNN架构有效捕捉了局部动态和长程信念传播,提升了干预策略质量。
- 该方法可扩展至大规模图(最多10^4个节点),而蒙特卡洛方法在此规模下变得计算不可行。
- 结合传播延迟模型的动态信念更新显著提高了感染传播预测的准确性。
- 通过稳定GNN中的消息传递,相比标准GNN,训练收敛性和策略性能均得到改善。
- 结合时序图处理的演员-评论家强化学习框架,实现了在部分可观测条件下的端到端干预策略学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。