Skip to main content
QUICK REVIEW

[论文解读] E-commerce warehousing: learning a storage policy

Adrien Rimélé, Philippe Grangier|arXiv (Cornell University)|Jan 21, 2021
Advanced Manufacturing and Logistics Optimization参考文献 36被引用 7
一句话总结

本文提出一种基于深度强化学习的方法,用于在电子商务机器人移动分拣系统(RMFS)中动态优化货架存储分配,采用部分可观测马尔可夫决策过程(POMDP)与深度Q-learning,以最小化机器人循环时间。该方法在传统策略基础上实现最高14%的行程时间效率提升,当结合前瞻滚动策略时,平均性能优于最佳基线策略7.58%。

ABSTRACT

E-commerce with major online retailers is changing the way people consume. The goal of increasing delivery speed while remaining cost-effective poses significant new challenges for supply chains as they race to satisfy the growing and fast-changing demand. In this paper, we consider a warehouse with a Robotic Mobile Fulfillment System (RMFS), in which a fleet of robots stores and retrieves shelves of items and brings them to human pickers. To adapt to changing demand, uncertainty, and differentiated service (e.g., prime vs. regular), one can dynamically modify the storage allocation of a shelf. The objective is to define a dynamic storage policy to minimise the average cycle time used by the robots to fulfil requests. We propose formulating this system as a Partially Observable Markov Decision Process, and using a Deep Q-learning agent from Reinforcement Learning, to learn an efficient real-time storage policy that leverages repeated experiences and insightful forecasts using simulations. Additionally, we develop a rollout strategy to enhance our method by leveraging more information available at a given time step. Using simulations to compare our method to traditional storage rules used in the industry showed preliminary results up to 14\% better in terms of travelling times.

研究动机与目标

  • 解决高需求波动性和快速配送要求下电子商务仓库中机器人循环时间最小化的问题。
  • 开发一种可实时适应订单流和需求模式变化的动态存储策略,适用于机器人移动分拣系统(RMFS)。
  • 通过利用重复经验学习与预测洞察,克服静态存储规则(如最短路径法SL和分类法)的局限性。
  • 通过减少机器人行程时间——高吞吐量、快节奏电子商务分拣中的主要瓶颈——提升系统吞吐量。
  • 集成滚动策略,通过预测未来订单影响来增强决策能力,即使新订单尚未完全揭示。

提出的方法

  • 将动态存储分配问题建模为部分可观测马尔可夫决策过程(POMDP),以捕捉订单到达与系统状态中的不确定性。
  • 训练一个深度Q-learning智能体,基于代表当前仓库状态的特征(包括需求预测和布局信息)学习最优存储决策。
  • 实施一种滚动策略,通过当前策略与Q值估计模拟有限时域轨迹,以实现前瞻性的动作选择优化。
  • 采用基于区域的存储分配方式,在保持策略灵活性与可扩展性的同时降低状态空间复杂度。
  • 在不同需求偏度下,通过基于仿真的评估,将所学策略与工业标准基线(如SL、分类法)进行对比。
  • 通过超参数调优,优化滚动时域长度,在计算成本与性能增益之间实现平衡。

实验结果

研究问题

  • RQ1强化学习智能体能否在不确定、快速变化的电子商务需求下,学习到一种有效的动态存储策略,从而减少RMFS中的机器人循环时间?
  • RQ2与无滚动策略的标准策略相比,集成前瞻滚动策略如何提升基于Q-learning的存储策略性能?
  • RQ3与传统的存储规则(如最短路径法SL和分类法)相比,所提出的深度Q-learning方法结合滚动策略的相对性能增益如何?
  • RQ4需求偏度(由参数s建模)在多大程度上影响所提出基于学习的存储策略性能?
  • RQ5滚动策略是否可有效应用于Q-learning智能体与基线策略,从而实现公平且可扩展的性能比较?

主要发现

  • 所提出的结合滚动策略的深度Q-learning智能体,在性能上平均优于最佳基线(SL结合滚动策略)7.58%,显著提升了机器人循环时间最小化效果。
  • 在无滚动策略的情况下,Q-learning智能体在循环时间减少方面优于最佳基线(SL)3.5%至5%,表明学习型策略具有显著价值。
  • 滚动策略使最短路径法策略的性能提升约6%,使Q-learning智能体的性能提升约4%,表明滚动策略在提升决策质量方面极为有效。
  • 在模拟中,该方法相比传统存储规则最高实现14%的行程时间改善,尤其在高需求偏度(s = 0.9–1.0)下表现突出。
  • 在需求分布偏斜时性能增益最为显著,此时智能体通过滚动策略预判未来订单模式的能力提供了关键优势。
  • 无论在何种需求偏度水平下,滚动增强的Q-learning策略始终优于所有其他配置,包括带滚动和不带滚动的基线SL策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。