[论文解读] Hybrid Multi-agent Deep Reinforcement Learning for Autonomous Mobility on Demand Systems
本文提出了一种混合多智能体深度强化学习框架,结合多智能体软 actor-critic 与集中式加权二分图匹配,实现自动驾驶按需出行(AMoD)系统中主动的、利润最大化的请求分配与拒绝。该方法在真实出租车数据上的性能、稳定性和计算效率均优于贪婪策略和模型预测控制(MPC)基线,相较于MPC最高提升5%,且在不同测试实例间表现更加一致。
We consider the sequential decision-making problem of making proactive request assignment and rejection decisions for a profit-maximizing operator of an autonomous mobility on demand system. We formalize this problem as a Markov decision process and propose a novel combination of multi-agent Soft Actor-Critic and weighted bipartite matching to obtain an anticipative control policy. Thereby, we factorize the operator's otherwise intractable action space, but still obtain a globally coordinated decision. Experiments based on real-world taxi data show that our method outperforms state of the art benchmarks with respect to performance, stability, and computational tractability.
研究动机与目标
- 解决在大规模、时变动作空间下,自动驾驶按需出行(AMoD)系统中主动的、利润最大化的请求分配与拒绝挑战。
- 通过多智能体学习分解动作空间,克服大规模AMoD系统中集中式决策的不可行性,同时保持全局协调。
- 开发一种可扩展且稳定的强化学习方法,结合深度学习与组合优化,实现实时调度决策。
- 在真实世界数据上,将所提方法与最先进的基线(包括贪婪策略和模型预测控制,MPC)进行基准对比,以验证其性能、稳定性和计算可行性。
提出的方法
- 该方法将AMoD调度问题建模为一个以利润最大化为目标的马尔可夫决策过程(MDP)。
- 采用多智能体软 actor-critic(SAC)算法,其中每辆车作为独立智能体,拥有去中心化的策略,同时由集中式评论家进行价值估计。
- 通过允许每个智能体独立选择候选请求,再经由集中式加权二分图匹配步骤协调冲突,确保全局最优分配。
- 加权二分图匹配利用SAC评论家学习到的状态-动作值,优先选择高利润、低成本的分配,确保协调且前瞻性的决策。
- 采用指数移动平均进行目标网络更新,并针对每个实例调整熵系数,以平衡探索与利用。
- 最终决策通过在候选匹配上求解集中式优化问题做出,实现在无需完整枚举动作空间的前提下,全局协调的调度。
实验结果
研究问题
- RQ1结合多智能体深度强化学习与集中式组合优化的混合方法,是否能在利润最大化的AMoD系统中,实现优于现有基线的性能与稳定性?
- RQ2在真实世界交通条件下,该方法与贪婪策略和模型预测控制(MPC)方法相比,在收入、计算效率和鲁棒性方面表现如何?
- RQ3当车辆与请求数量超过训练配置时,该方法是否仍能保持一致的性能表现,表明其具备可扩展性与非参数化行为?
- RQ4在该场景下,使用离策略的 actor-critic 算法(SAC)相较于基于值函数的多智能体DRL方法,是否能显著提升样本效率与学习稳定性?
主要发现
- 所提方法在所有测试实例中相较贪婪基线最高提升5%,在利润最大化方面表现出一致的增益。
- 该方法在大多数情况下显著优于MPC,MPC在个别实例中甚至比贪婪策略差60%,凸显了MPC在真实世界随机性下的不稳定性。
- 该方法在不同测试日和系统配置下表现出更优的性能稳定性,结果方差极小,远优于MPC的波动表现。
- 当应用于车辆与请求数量超过训练配置的系统时,该方法仍保持强劲性能,表明其具备非参数化可扩展性,并对系统规模变化具有鲁棒性。
- 训练过程显示稳定收敛,验证奖励随时间稳步提升并达到正值,表明学习过程有效。
- 消融实验确认,混合设计——即结合多智能体SAC与集中式匹配——至关重要,若移除任一组件或替换为更简单的基线,性能将显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。