Skip to main content
QUICK REVIEW

[论文解读] Can Sophisticated Dispatching Strategy Acquired by Reinforcement Learning? - A Case Study in Dynamic Courier Dispatching System

Yujie Chen, Qian Yu|arXiv (Cornell University)|Mar 7, 2019
Transportation and Mobility Innovations参考文献 24被引用 16
一句话总结

本文提出了一种多智能体强化学习(MARL)框架,用于解决实时电子商务取件服务中的动态快递员派送问题(CDP)。通过将问题建模为马尔可夫决策过程,并采用分层状态表示与奖励塑造,MARL 学习到复杂的长期派送策略,其性能优于人工设计的和短视的在线算法,在真实世界与合成数据上的实验中实现了13%的收入提升。

ABSTRACT

In this paper, we study a courier dispatching problem (CDP) raised from an online pickup-service platform of Alibaba. The CDP aims to assign a set of couriers to serve pickup requests with stochastic spatial and temporal arrival rate among urban regions. The objective is to maximize the revenue of served requests given a limited number of couriers over a period of time. Many online algorithms such as dynamic matching and vehicle routing strategy from existing literature could be applied to tackle this problem. However, these methods rely on appropriately predefined optimization objectives at each decision point, which is hard in dynamic situations. This paper formulates the CDP as a Markov decision process (MDP) and proposes a data-driven approach to derive the optimal dispatching rule-set under different scenarios. Our method stacks multi-layer images of the spatial-and-temporal map and apply multi-agent reinforcement learning (MARL) techniques to evolve dispatching models. This method solves the learning inefficiency caused by traditional centralized MDP modeling. Through comprehensive experiments on both artificial dataset and real-world dataset, we show: 1) By utilizing historical data and considering long-term revenue gains, MARL achieves better performance than myopic online algorithms; 2) MARL is able to construct the mapping between complex scenarios to sophisticated decisions such as the dispatching rule. 3) MARL has the scalability to adopt in large-scale real-world scenarios.

研究动机与目标

  • 解决城市电子商务取件服务中具有随机时空需求模式的动态实时快递员派送挑战。
  • 开发一种数据驱动、可扩展的调度策略,以捕捉长期收入增益,而非依赖于短视的优化目标。
  • 克服集中式MDP建模与传统在线算法在具有延迟奖励和智能体交互的复杂动态环境中所面临的局限性。
  • 设计一种去中心化的MARL框架,并通过有效的奖励塑造促进快递员之间的协作。
  • 在合成数据与真实世界的城市取件数据集上,验证该方法的泛化能力与可扩展性。

提出的方法

  • 将CDP建模为具有分层结构的马尔可夫决策过程(MDP):派送层级(快递员到网格的分配)与路径规划层级(时间窗约束的探险家问题)。
  • 空间与时间需求模式通过堆叠的多层网格图像编码,表示过去2小时内历史请求密度、时间窗与服务价值。
  • 采用去中心化控制的多智能体强化学习(MARL)算法进行训练,每位快递员作为基于其局部观测独立行动的智能体。
  • 应用奖励塑造以促进协作:智能体根据成功完成请求情况,获得延迟的累积奖励,信用分配机制被调整以处理长时程依赖性。
  • 策略网络采用深度Q学习,结合经验回放与目标网络以稳定训练过程,状态空间包含空间网格、快递员可用性以及请求元数据(如时间窗、价格)。
  • 该方法使用合成数据与杭州的真实取件数据进行评估,并通过消融研究对比MARL与GHEP、随机策略及MBM基线方法。

实验结果

研究问题

  • RQ1MARL能否学习到一种派送策略,使其在动态快递员派送中优于人工设计的短视在线算法?
  • RQ2在具有延迟奖励的去中心化MARL设置中,奖励塑造在促进快递员之间协作方面的有效性如何?
  • RQ3MARL策略在面对不同客户时间窗分布、动态请求比例与区域配置变化等未见场景时,其泛化能力达到何种程度?
  • RQ4与贪婪或基于规则的方法相比,MARL驱动的调度策略是否通过捕捉时空需求模式,实现了更好的长期收入?
  • RQ5在拥有数百名快递员与请求的大规模城市环境中,所提出的MARL框架的可扩展性如何?

主要发现

  • MARL-EP在所有基线中表现最优,在车队2实验中实现比GHEP策略高13%的总收入,且在训练超过1,000个回合后性能超越GHEP。
  • MARL-EP策略展现出卓越的长期规划能力,能够预先派送至偏远孤立区域,而短视策略因即时回报低而无法覆盖这些区域。
  • 该方法在未见场景中表现出良好的泛化能力,包括客户时间窗分布变化、动态请求比例波动以及区域布局调整,证实了模型的鲁棒性。
  • 去中心化的MARL结合奖励塑造有效促进了智能体间的协作,减少了冗余竞争,并在时空维度上提升了供需匹配效率。
  • MARL框架在大规模数据集上表现出良好的可扩展性,车队4(每位快递员独立训练)的性能与车队1(共享策略)相当,尽管因单个智能体样本量较小导致学习速度较慢。
  • 轨迹分析表明,MARL-EP智能体遵循更具战略性和适应性的路径,与不断变化的请求热点保持一致,而随机或贪婪策略则不具备此类特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。