Skip to main content
QUICK REVIEW

[论文解读] Hybrid Multi-agent Deep Reinforcement Learning for Autonomous Mobility on Demand Systems

Tobias Enders, J. Harrison|arXiv (Cornell University)|Dec 14, 2022
Transportation and Mobility Innovations被引用 6
一句话总结

本文提出了一种混合多智能体深度强化学习框架,结合多智能体软 actor-critic 与集中式加权二分图匹配,实现自动驾驶按需出行(AMoD)系统中主动的、利润最大化的请求分配与拒绝。该方法在真实出租车数据上的性能、稳定性和计算效率均优于贪婪策略和模型预测控制(MPC)基线,相较于MPC最高提升5%,且在不同测试实例间表现更加一致。

ABSTRACT

We consider the sequential decision-making problem of making proactive request assignment and rejection decisions for a profit-maximizing operator of an autonomous mobility on demand system. We formalize this problem as a Markov decision process and propose a novel combination of multi-agent Soft Actor-Critic and weighted bipartite matching to obtain an anticipative control policy. Thereby, we factorize the operator's otherwise intractable action space, but still obtain a globally coordinated decision. Experiments based on real-world taxi data show that our method outperforms state of the art benchmarks with respect to performance, stability, and computational tractability.

研究动机与目标

  • 解决在大规模、时变动作空间下,自动驾驶按需出行(AMoD)系统中主动的、利润最大化的请求分配与拒绝挑战。
  • 通过多智能体学习分解动作空间,克服大规模AMoD系统中集中式决策的不可行性,同时保持全局协调。
  • 开发一种可扩展且稳定的强化学习方法,结合深度学习与组合优化,实现实时调度决策。
  • 在真实世界数据上,将所提方法与最先进的基线(包括贪婪策略和模型预测控制,MPC)进行基准对比,以验证其性能、稳定性和计算可行性。

提出的方法

  • 该方法将AMoD调度问题建模为一个以利润最大化为目标的马尔可夫决策过程(MDP)。
  • 采用多智能体软 actor-critic(SAC)算法,其中每辆车作为独立智能体,拥有去中心化的策略,同时由集中式评论家进行价值估计。
  • 通过允许每个智能体独立选择候选请求,再经由集中式加权二分图匹配步骤协调冲突,确保全局最优分配。
  • 加权二分图匹配利用SAC评论家学习到的状态-动作值,优先选择高利润、低成本的分配,确保协调且前瞻性的决策。
  • 采用指数移动平均进行目标网络更新,并针对每个实例调整熵系数,以平衡探索与利用。
  • 最终决策通过在候选匹配上求解集中式优化问题做出,实现在无需完整枚举动作空间的前提下,全局协调的调度。

实验结果

研究问题

  • RQ1结合多智能体深度强化学习与集中式组合优化的混合方法,是否能在利润最大化的AMoD系统中,实现优于现有基线的性能与稳定性?
  • RQ2在真实世界交通条件下,该方法与贪婪策略和模型预测控制(MPC)方法相比,在收入、计算效率和鲁棒性方面表现如何?
  • RQ3当车辆与请求数量超过训练配置时,该方法是否仍能保持一致的性能表现,表明其具备可扩展性与非参数化行为?
  • RQ4在该场景下,使用离策略的 actor-critic 算法(SAC)相较于基于值函数的多智能体DRL方法,是否能显著提升样本效率与学习稳定性?

主要发现

  • 所提方法在所有测试实例中相较贪婪基线最高提升5%,在利润最大化方面表现出一致的增益。
  • 该方法在大多数情况下显著优于MPC,MPC在个别实例中甚至比贪婪策略差60%,凸显了MPC在真实世界随机性下的不稳定性。
  • 该方法在不同测试日和系统配置下表现出更优的性能稳定性,结果方差极小,远优于MPC的波动表现。
  • 当应用于车辆与请求数量超过训练配置的系统时,该方法仍保持强劲性能,表明其具备非参数化可扩展性,并对系统规模变化具有鲁棒性。
  • 训练过程显示稳定收敛,验证奖励随时间稳步提升并达到正值,表明学习过程有效。
  • 消融实验确认,混合设计——即结合多智能体SAC与集中式匹配——至关重要,若移除任一组件或替换为更简单的基线,性能将显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。