[论文解读] Efficient Ridesharing Dispatch Using Multi-Agent Reinforcement Learning
本文提出一种基于QMIX的多智能体强化学习方法,用于高效拼车调度,通过集中式训练与分布式执行,提升乘车完成速度并增强泛化能力。在固定和可变大小的网格中,其表现优于IDQN和贪心基线方法,最大地图上平均等待时间减少达20.3%。
With the advent of ride-sharing services, there is a huge increase in the number of people who rely on them for various needs. Most of the earlier approaches tackling this issue required handcrafted functions for estimating travel times and passenger waiting times. Traditional Reinforcement Learning (RL) based methods attempting to solve the ridesharing problem are unable to accurately model the complex environment in which taxis operate. Prior Multi-Agent Deep RL based methods based on Independent DQN (IDQN) learn decentralized value functions prone to instability due to the concurrent learning and exploring of multiple agents. Our proposed method based on QMIX is able to achieve centralized training with decentralized execution. We show that our model performs better than the IDQN baseline on a fixed grid size and is able to generalize well to smaller or larger grid sizes. Also, our algorithm is able to outperform IDQN baseline in the scenario where we have a variable number of passengers and cars in each episode. Code for our paper is publicly available at: https://github.com/UMich-ML-Group/RL-Ridesharing.
研究动机与目标
- 解决在高维状态与动作空间的动态城市环境中高效拼车调度的挑战。
- 克服独立DQN(IDQN)等去中心化多智能体强化学习方法因并发学习导致的非平稳性问题。
- 实现在不同网格尺寸及每轮中乘客与车辆数量变化下的泛化能力。
- 通过在调度决策中引入先到先服务(FCFS)优先机制,降低乘客等待时间。
- 展示基于QMIX的训练方法在真实拼车场景中具备更优的性能与可扩展性,且采用去中心化执行。
提出的方法
- 采用QMIX,一种多智能体强化学习算法,通过学习作为个体智能体Q值单调函数的全局价值函数,实现在集中式训练与去中心化执行。
- 采用非线性、单调的个体Q值组合方式,以估计联合动作值,确保智能体间策略优化的一致性。
- 将拼车环境建模为具有动态乘客请求与车辆移动的网格世界,使用先到先服务(FCFS)优先规则以减少乘客等待时间。
- 使用深度Q网络配合经验回放与目标网络进行训练,以稳定学习过程,同时在推理阶段保持独立动作选择。
- 通过课程学习策略,在固定100×100网格上进行训练,并评估其在更小(10×10)和更大(500×500)网格上的泛化能力。
- 使用RLPyT构建的仿真环境,支持在相同条件下对多种算法进行训练与评估。
实验结果
研究问题
- RQ1在固定网格与固定智能体数量下,基于QMIX的多智能体强化学习方法是否优于独立DQN(IDQN)在拼车调度中的表现?
- RQ2QMIX模型在泛化到小于或大于其训练网格尺寸的场景时,是否具备有效泛化能力?
- RQ3当每轮中乘客与车辆数量发生变化时,模型表现如何?
- RQ4在调度策略中集成先到先服务(FCFS)优先机制是否能有效降低乘客等待时间?
- RQ5QMIX中采用的集中式训练与去中心化执行机制,如何缓解IDQN方法中固有的非平稳性问题?
主要发现
- 在100×100网格上,固定10名乘客与10辆车时,QMIX将平均等待时间降低至195.66,优于IDQN(199.43)、贪心基线(201.85)与随机策略(209.03)。
- 在500×500网格上,25名乘客与20辆车时,QMIX的等待时间为12,812.79,较贪心基线(13,871.07)降低8.3%。
- 从100×100网格泛化至10×10网格(7名乘客与2辆车)时,QMIX较贪心策略快9.2%,较泛化IDQN快2.3%。
- 在500×500网格上,25名乘客与20辆车时,QMIX在等待时间上较贪心策略降低20.3%,较IDQN降低12.7%。
- QMIX在几乎所有配置下均比IDQN展现出更优的泛化能力,且无任何情况下其性能比IDQN慢超过2.5%。
- 模型在不同智能体数量下均保持强劲表现,证明其在动态拼车场景中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。