Skip to main content
QUICK REVIEW

[论文解读] Same-Day Delivery with Fairness

Xinwei Chen, Tong Wang|arXiv (Cornell University)|Jul 19, 2020
Transportation and Mobility Innovations参考文献 20被引用 12
一句话总结

本文提出一种基于深度Q-learning的方法,用于优化同日达(SDD)服务,以平衡整体服务效用与地理公平性——即各区域的最低区域服务率。通过引入一种从基于速率到基于增量服务单位的学习的新转换方法,该方法稳定了训练过程,并在将最低区域服务率从5%提升至46%时,仅造成6.2%的效用损失,显著提升了公平性。

ABSTRACT

The demand for same-day delivery (SDD) has increased rapidly in the last few years and has particularly boomed during the COVID-19 pandemic. The fast growth is not without its challenge. In 2016, due to low concentrations of memberships and far distance from the depot, certain minority neighborhoods were excluded from receiving Amazon's SDD service, raising concerns about fairness. In this paper, we study the problem of offering fair SDD-service to customers. The service area is partitioned into different regions. Over the course of a day, customers request for SDD service, and the timing of requests and delivery locations are not known in advance. The dispatcher dynamically assigns vehicles to make deliveries to accepted customers before their delivery deadline. In addition to the overall service rate (utility), we maximize the minimal regional service rate across all regions (fairness). We model the problem as a multi-objective Markov decision process and develop a deep Q-learning solution approach. We introduce a novel transformation of learning from rates to actual services, which creates a stable and efficient learning process. Computational results demonstrate the effectiveness of our approach in alleviating unfairness both spatially and temporally in different customer geographies. We also show this effectiveness is valid with different depot locations, providing businesses with an opportunity to achieve better fairness from any location. Further, we consider the impact of ignoring fairness in service, and results show that our policies eventually outperform the utility-driven baseline when customers have a high expectation on service level.

研究动机与目标

  • 解决同日达(SDD)服务中日益突出的空间不公问题,例如亚马逊因少数族裔社区会员密度低及距配送中心距离远而将其排除在外。
  • 构建一个多目标SDD问题,旨在最大化整体服务率(效用)与最小区域服务率(公平性),以确保不同地理区域间的公平接入。
  • 开发一种可扩展的实时决策框架,避免耗时的重新优化,支持在不确定、随时间变化的客户请求下进行动态车辆路径规划。
  • 通过引入一种新颖的转换方法,避免基于速率目标训练时的不稳定性:不再优化具有变化分母的速率,而是优化增量服务单位,从而实现稳定且高效的深度强化学习。

提出的方法

  • 将SDD问题建模为多目标马尔可夫决策过程(MDP),采用整体服务率期望值与最小区域服务率的加权组合。
  • 使用深度Q-learning与神经网络近似Q值,实现离线策略训练与无需重新优化的实时推理。
  • 提出一种新颖的目标函数转换:不直接优化速率(其分母会变化),而是优化增量服务单位,从而稳定学习过程并提升收敛性。
  • 定义状态表示以捕捉动态信息:当前车辆位置、待处理请求、一天中的时间以及区域需求模式。
  • 使用结合效用(接受请求数量)与公平性(对低区域服务率的惩罚)的奖励函数训练策略,支持可调节的效用与公平性权衡。
  • 在具有不同配送中心位置与需求分布的合成及真实客户地理分布上验证该方法。

实验结果

研究问题

  • RQ1基于强化学习的方法是否能有效在同日达服务中平衡效用与公平性,同时不牺牲实时性能?
  • RQ2与直接优化速率相比,所提出的从基于速率到基于增量服务单位的学习转换在提升训练稳定性和策略性能方面有何优势?
  • RQ3该方法在多样化客户地理分布下,能在多大程度上减少SDD服务可用性的空间与时间不公平性?
  • RQ4在客户对服务可用性有高期望的背景下,忽略公平性对SDD服务设计的长期影响是什么,特别是其后果?
  • RQ5该方法对配送中心选址决策有何影响?在现有或次优配送中心配置下,其在公平性与效用之间的权衡机制如何?

主要发现

  • 所提方法显著降低了不同地理区域间SDD服务交付的不公平性,将最低区域服务率提升至46%,同时整体效用仅损失6.2%。
  • 当客户对服务水平的期望较高(如70%阈值)时,公平性感知策略在公平性与整体效用方面均优于仅追求效用的基线策略,尤其在长期时间范围内表现更优。
  • 公平性权衡参数α=0.5的策略在为期一年的模拟中保持了稳定性能,而仅追求效用的基线策略则在服务不足区域逐渐失去客户,性能持续下降。
  • 公平性感知策略在所有区域,特别是低需求或偏远地区,维持了更高的服务水平,并将性能下降延迟至更高的服务期望水平才出现。
  • 该方法使企业能够在不迁至服务不足区域的情况下,利用现有配送中心实现更公平的服务,从而相比物理配送中心重新定位,显著降低了公平性的成本。
  • 忽略公平性会导致长期收入损失,因为服务不足区域的客户会逐渐疏远,即使短期效用更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。