Skip to main content
QUICK REVIEW

[论文解读] Approximate Dynamic Programming for Delivery Time Slot Pricing: a Sensitivity Analysis

Denis Lebedev, Kostas Margellos|arXiv (Cornell University)|Aug 3, 2020
Supply Chain and Inventory Management参考文献 19被引用 5
一句话总结

本文提出梯度有界动态规划(GDP)作为一种更优的近似动态规划方法,用于优化有人值守的上门配送时间槽定价,在利润生成和计算效率方面均优于仿射和非线性随机对偶DP方法。GDP利用凸优化计算具有状态反馈的非线性值函数近似,可在模型不确定性下实现稳健且实时的定价。

ABSTRACT

We consider the revenue management problem of finding profit-maximising prices for delivery time slots in the context of attended home delivery. This multi-stage optimal control problem admits a dynamic programming formulation that is intractable for realistic problem sizes due to the so-called "curse of dimensionality". Therefore, we study three approximate dynamic programming algorithms both from a control-theoretical perspective and in a parametric numerical case study. Our numerical analysis is based on real-world data, from which we generate multiple scenarios to stress-test the robustness of the pricing policies to errors in model parameter estimates. Our theoretical analysis and numerical benchmark tests show that one of these algorithms, namely gradient-bounded dynamic programming, dominates the others with respect to computation time and profit-generation capabilities of the delivery slot pricing policies that it generates. Finally, we show that uncertainty in the estimates of the model parameters further increases the profit-generation dominance of this approach.

研究动机与目标

  • 通过优化时间槽定价以最大化利润,解决有人值守配送中的收益管理挑战。
  • 克服真实配送物流问题中动态规划的维度灾难问题。
  • 评估并比较三种近似动态规划算法——仿射值函数近似、非线性随机对偶DP和梯度有界DP——在计算效率和利润生成方面的表现。
  • 利用真实世界数据和多场景压力测试,评估算法在模型参数不确定性下的鲁棒性。
  • 证明梯度有界DP在利润和计算时间方面均表现更优,尤其在估计误差下依然具有优势。

提出的方法

  • 将[13]中的梯度有界DP算法适配至有人值守配送收益管理问题,利用凸优化计算非线性值函数近似。
  • 将定价问题建模为具有来自各配送时间槽订单数量状态反馈的多阶段最优控制问题。
  • 使用多项式Logit模型表示客户在不同时间槽和价格下的选择行为,参数基于真实世界数据估计。
  • 通过省略一个冗余正则化项,实现非线性随机对偶DP的简化版本,同时保留闭环控制能力。
  • 将仿射值函数近似作为基线方法,指出其理论局限性:由于梯度恒定,会产生开环控制器。
  • 开展多场景数值案例研究,参数不确定性水平各异(σ² ∈ {0.01, 0.1, 1}),以测试在估计误差下的鲁棒性和性能。

实验结果

研究问题

  • RQ1不同近似动态规划算法在配送时间槽定价中的利润生成和计算速度方面表现如何?
  • RQ2在该情境下,仿射值函数近似方法的理论局限性是什么?其对控制反馈结构有何影响?
  • RQ3非线性值函数近似(来自随机对偶DP)是否能提供优于仿射近似的更好状态反馈?其计算权衡如何?
  • RQ4客户选择模型中的参数不确定性如何影响各算法的性能?哪种算法最具鲁棒性?
  • RQ5在现实的模型估计误差下,梯度有界DP是否仍能保持其性能优势?原因是什么?

主要发现

  • 梯度有界DP在利润生成方面显著优于仿射值函数近似,尤其在参数不确定性下,当σ² = 1时,利润下降幅度降低了整整一个数量级。
  • 仿射值函数近似方法因梯度恒定而产生开环控制器,导致所有可行状态下定价相同,对模型误差鲁棒性差。
  • 非线性随机对偶DP提供状态反馈并具备对不确定性的鲁棒性,但因需求解非凸优化问题,计算成本极高。
  • 梯度有界DP实现了最佳平衡,通过凸优化生成非线性值函数近似,既实现高利润又具备快速计算能力。
  • 随着参数不确定性增加(σ² 从 0.01 到 1),GDP和非线性对偶DP保持强劲表现,而仿射近似则急剧下降,预期利润最高损失达90%。
  • 案例研究证实,即使客户选择模型参数被误设,GDP在利润和计算时间方面的优势依然保持,证明了其实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。