[论文解读] Assessing the Performance of Deep Learning Algorithms for Newsvendor Problem
本文提出了一种基于深度学习的多特征新svendor问题方法,采用原始的不可微分新svendor损失函数作为训练目标,相较于常用的二次损失函数表现出更优的性能。该方法通过避免过拟合,在保持强样本内拟合的同时,实现了更好的泛化能力和对异常值的鲁棒性。
In retailer management, the Newsvendor problem has widely attracted attention as one of basic inventory models. In the traditional approach to solving this problem, it relies on the probability distribution of the demand. In theory, if the probability distribution is known, the problem can be considered as fully solved. However, in any real world scenario, it is almost impossible to even approximate or estimate a better probability distribution for the demand. In recent years, researchers start adopting machine learning approach to learn a demand prediction model by using other feature information. In this paper, we propose a supervised learning that optimizes the demand quantities for products based on feature information. We demonstrate that the original Newsvendor loss function as the training objective outperforms the recently suggested quadratic loss function. The new algorithm has been assessed on both the synthetic data and real-world data, demonstrating better performance.
研究动机与目标
- 解决传统新svendor模型依赖于需求分布强假设的局限性。
- 开发一种基于深度学习的方法,直接利用特征信息优化订货量,而无需假设已知的需求分布。
- 评估在该问题的深度学习训练中,原始新svendor损失函数是否优于二次损失函数。
- 研究缺货成本 $ c_p $ 和持有成本 $ c_h $ 对模型训练和性能的影响。
提出的方法
- 将原始新svendor损失函数 $ C(y) = \mathbb{E}_d[c_p(d-y)_+ + c_h(y-d)_+] $ 集成到深度神经网络中,实现端到端训练。
- 通过改进梯度计算方式,对反向传播算法进行调整,以处理原始损失函数的不可微性。
- 使用合成数据和真实世界零售需求数据集,在不同成本比 $ c_p/c_h $ 下进行模型训练与验证。
- 采用具有多层隐藏层的前馈神经网络架构,以学习输入特征与最优订货量之间的复杂非线性关系。
- 将使用原始新svendor损失函数的模型性能与Oroojlooyjadid等人(2016)提出的二次损失函数进行比较。
- 采用交叉验证,并评估训练误差与测试误差,以衡量样本内拟合度与样本外泛化能力。
实验结果
研究问题
- RQ1尽管存在不可微性,原始新svendor损失函数是否能有效集成到深度学习框架中?
- RQ2与使用二次损失函数相比,使用原始新svendor损失函数进行训练是否能在泛化能力和鲁棒性方面表现更优?
- RQ3缺货成本 $ c_p $ 与持有成本 $ c_h $ 的相对值如何影响新svendor设定下深度学习模型的训练动态与预测精度?
- RQ4在需求数据存在异常值的情况下,该模型的表现如何,尤其与使用二次损失函数训练的模型相比?
主要发现
- 原始新svendor损失函数在泛化性能方面始终优于二次损失函数,尤其在测试数据上表现更优,表明其具有更强的样本外性能。
- 采用原始损失函数训练的模型对异常值表现出更优的鲁棒性,避免对极端需求值的过拟合;而二次损失模型则试图拟合这些异常值,导致泛化能力下降。
- 在存在大异常值的情况下,原始损失函数在训练初期的训练误差高于二次损失函数,证实其避免了对噪声数据的过拟合。
- 原始损失函数在保持强样本内拟合的同时实现了更优的样本外性能,展现出偏差与方差之间的有利权衡。
- 对于需求范围较小的数据,原始损失函数在防止过拟合方面的优势不那么明显,表明其优势具有情境依赖性。
- 结果证实,原始损失函数更适合用于基于深度学习的新svendor模型,尤其是在需求分布未知或非正态的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。