[论文解读] Reinforced Epidemic Control: Saving Both Lives and Economy
本文提出 DURLECA,一种双目标强化学习框架,仅使用起讫点(OD)出行数据,动态调控区域间出行并抑制疫情传播,且不依赖个人隐私数据。通过利用一种新型 Flow-GNN 估算传播风险,并设计兼顾感染控制与出行保留的奖励函数,DURLECA 在真实世界实验中将感染人数降至接近零,同时保留了 76% 的城市出行量。
Saving lives or economy is a dilemma for epidemic control in most cities while smart-tracing technology raises people's privacy concerns. In this paper, we propose a solution for the life-or-economy dilemma that does not require private data. We bypass the private-data requirement by suppressing epidemic transmission through a dynamic control on inter-regional mobility that only relies on Origin-Designation (OD) data. We develop DUal-objective Reinforcement-Learning Epidemic Control Agent (DURLECA) to search mobility-control policies that can simultaneously minimize infection spread and maximally retain mobility. DURLECA hires a novel graph neural network, namely Flow-GNN, to estimate the virus-transmission risk induced by urban mobility. The estimated risk is used to support a reinforcement learning agent to generate mobility-control actions. The training of DURLECA is guided with a well-constructed reward function, which captures the natural trade-off relation between epidemic control and mobility retaining. Besides, we design two exploration strategies to improve the agent's searching efficiency and help it get rid of local optimums. Extensive experimental results on a real-world OD dataset show that DURLECA is able to suppress infections at an extremely low level while retaining 76\% of the mobility in the city. Our implementation is available at https://github.com/anyleopeace/DURLECA/.
研究动机与目标
- 在不依赖个人出行数据的前提下,解决疫情控制中的生存与经济之间的两难问题。
- 开发一种动态的、区域特定的出行控制策略,以最小化病毒传播,同时最大化保留的出行量。
- 设计一种强化学习框架,能够有效应对疫情控制中非凸、多目标的策略空间。
- 通过避免对任一区域实施长期连续隔离,确保方法的实用性。
- 通过新颖的探索策略,提升策略搜索中的探索效率,并有效逃离局部最优解。
提出的方法
- DURLECA 采用一种名为 Flow-GNN 的图神经网络(GNN)架构,在图结构上建模城市出行流中的病毒传播风险。
- Flow-GNN 能够捕捉沿区域间 OD 流传播的感染动态,实现在无需个体数据的前提下进行风险估计。
- 一个双目标强化学习智能体利用估计出的风险,生成兼顾感染抑制与出行保留的出行控制动作。
- 奖励函数被精心设计,以反映减少感染与保留出行之间的自然权衡,特别处理了连续与间歇性限制的区别。
- 引入两种定制化的探索策略,以提升策略搜索效率,并避免在复杂、非凸的策略空间中陷入局部最优。
- 该框架在真实世界的 OD 出行数据集上进行训练与评估,证明了其在有效抑制疫情爆发的同时,维持高水平出行的高效性。
实验结果
研究问题
- RQ1是否仅使用聚合的 OD 出行数据,而无需依赖个人追踪数据,即可有效实现疫情控制?
- RQ2如何训练强化学习智能体,以在最小化感染与最大化保留出行之间实现平衡?
- RQ3何种神经网络架构能够准确建模通过城市出行流传播病毒的风险?
- RQ4如何改进策略空间中的探索方法,以避免在非凸、高维环境中的局部最优解?
- RQ5在真实场景中,动态的、区域特定的出行控制策略是否能优于静态或统一的封锁策略?
主要发现
- DURLECA 有效将疫情传播抑制至极低水平,在真实 OD 数据实验中实现接近零感染率。
- 该框架在维持有效疫情控制的同时,保留了 76% 的原始城市出行量,显著优于全面封锁在经济保护方面的表现。
- Flow-GNN 架构能有效建模病毒沿出行流传播的动力学,其在捕捉传播风险方面优于标准 GNN。
- 双目标奖励函数使强化学习智能体能够找到在最小化感染的同时不过度限制出行的平衡策略。
- 所提出的两种探索策略显著提升了智能体逃离局部最优解的能力,并发现了高性能策略。
- 该方法表明,无需个人数据即可实现有效疫情控制,为个体追踪提供了一种保护隐私的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。