[论文解读] Reinforcement Learning for Multi-Product Multi-Node Inventory Management in Supply Chains
本文提出了一种基于优势演员-critic(A2C)算法与量化动作空间的分层多智能体强化学习(MARL)框架,用于解决供应链中大规模、多产品、多节点的库存管理问题。实验表明,该强化学习方法优于启发式方法,并接近全知性能,即使在通过迁移学习应对新产品和新门店等动态变化时仍表现良好。
This paper describes the application of reinforcement learning (RL) to multi-product inventory management in supply chains. The problem description and solution are both adapted from a real-world business solution. The novelty of this problem with respect to supply chain literature is (i) we consider concurrent inventory management of a large number (50 to 1000) of products with shared capacity, (ii) we consider a multi-node supply chain consisting of a warehouse which supplies three stores, (iii) the warehouse, stores, and transportation from warehouse to stores have finite capacities, (iv) warehouse and store replenishment happen at different time scales and with realistic time lags, and (v) demand for products at the stores is stochastic. We describe a novel formulation in a multi-agent (hierarchical) reinforcement learning framework that can be used for parallelised decision-making, and use the advantage actor critic (A2C) algorithm with quantised action spaces to solve the problem. Experiments show that the proposed approach is able to handle a multi-objective reward comprised of maximising product sales and minimising wastage of perishable products.
研究动机与目标
- 解决仓库与多个门店之间共享容量条件下,50至1000种产品的并行库存管理挑战。
- 建立一个包含仓库、门店及运输环节有限容量的真实世界两级供应链模型,并考虑随机、时滞补货机制。
- 利用多智能体强化学习构建可扩展、可并行化的决策系统,实现跨不同时间尺度与节点的协调。
- 通过迁移学习实现动态可扩展性——在不进行完整重训练的情况下支持新增产品和新门店。
- 优化多目标奖励函数,平衡销售最大化与易腐品损耗最小化。
提出的方法
- 将供应链建模为分层多智能体强化学习问题,将门店与仓库视为独立智能体。
- 采用优势演员-critic(A2C)算法并结合量化动作空间,以在离散动作步长中处理连续补货决策。
- 将训练分解为两个阶段:首先在假设仓库容量无限的前提下训练门店智能体,然后利用门店累计表现作为其标量奖励的一部分来训练仓库智能体。
- 在环境动力学中整合时滞补货与有限容量(仓库、门店、卡车)。
- 通过复用预训练模型实现迁移学习:对新产品或新门店仅微调归一化统计量,无需重新训练。
- 定义多目标奖励函数,综合考虑销售最大化与易腐品损耗最小化。
实验结果
研究问题
- RQ1分层多智能体强化学习框架能否有效协调有限容量供应链中多个产品与节点的补货决策?
- RQ2与启发式策略及全知oracle相比,所提出的强化学习方法在销售与损耗方面的表现如何?
- RQ3迁移学习在多大程度上可使强化学习模型在无需重训练的情况下泛化至新产品与新门店?
- RQ4所学习的策略对不同产品数量(50、220、1000)下的库存水平与需求预测变化有何响应?
- RQ5在共享卡车容量与随机需求等系统约束下,强化学习系统能否保持性能?
主要发现
- 在50、220和1000种产品场景下,强化学习智能体在所有情况下均优于启发式策略,仓库性能提升最高达46%,门店提升最高达40%。
- 在50种产品场景下,强化学习模型的归一化性能达到0.428(仓库)和0.764–0.796(门店),优于启发式方法(0.299–0.673),并接近全知策略(0.498–0.837)。
- 通过迁移学习,仓库模型在无需重训练的情况下成功处理了容量为门店1的1.75倍的新门店(门店4),性能达0.446,优于启发式方法(0.373),并接近全知性能(0.544)。
- 在扩展至1000种产品时,强化学习策略因容量限制而请求更低的平均补货量,反映出对大数定律的合理响应。
- 策略热力图显示,补货行为随库存降低和需求预测升高而增加,随库存上升或预测下降而减少,表明行为符合直觉且稳定。
- 模型对动态变化表现出鲁棒性:通过归一化统计量的适应,无需架构或训练调整即可无缝适应新增产品与新门店。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。