[论文解读] A multi-series framework for demand forecasts in E-commerce
本文提出了一种基于全局XGBoost的电商需求预测框架,通过利用跨系列信息和非线性关系,提升了在短周期、高波动性销售时间序列上的预测精度。通过引入分层产品分组、季节性特征以及先进的预处理方法以应对‘虚假零’和稀疏数据问题,与最先进基准相比,该模型将RMSE降低10%,MAE降低5%,尤其在产品生命周期早期阶段的预测中表现显著提升。
Sales forecasts are crucial for the E-commerce business. State-of-the-art techniques typically apply only univariate methods to make prediction for each series independently. However, due to the short nature of sales times series in E-commerce, univariate methods don't apply well. In this article, we propose a global model which outperforms state-of-the-art models on real dataset. It is achieved by using Tree Boosting Methods that exploit non-linearity and cross-series information. We also proposed a preprocessing framework to overcome the inherent difficulties in the E-commerce data. In particular, we use different schemes to limit the impact of the volatility of the data.
研究动机与目标
- 为解决电商中因历史数据有限而导致单变量模型失效的短周期、高波动性销售时间序列预测挑战。
- 通过全局建模方法在相关产品系列之间共享信息,提升预测精度。
- 通过利用群体级模式和协变量,实现对历史数据极少的新产品实现冷启动预测。
- 通过定制化的预处理流程,克服‘虚假零’、非平稳性和突发性销售等特定数据挑战。
- 在真实电商数据上评估该框架,并证明其在行业基准和最先进方法上的卓越性能。
提出的方法
- 该框架使用XGBoost对所有产品进行全局需求预测,学习个体及跨系列模式。
- 引入三类协变量:时间类(如节假日)、纵向类(如产品类别)和混合类(如周价格),以增强特征表示。
- 季节性特征源自相似产品的聚合行为,即使在个体系列较短的情况下也能实现稳健估计。
- 预处理流程通过在非零销售区间上使用单变量预测方法,识别并填补‘虚假零’(如因缺货导致)。
- 分类特征通过序数编码或哈希编码进行处理,实验表明序数编码表现更优。
- 模型在大规模电商数据集上端到端训练,包含分层产品分组和时间特征,使用RMSE和MAE作为评估指标。
实验结果
研究问题
- RQ1能否通过在产品系列之间共享信息的全局提升模型,在短周期、高波动性的电商销售时间序列上超越单变量预测方法?
- RQ2分层产品分组和跨系列信息在提升历史数据有限产品的预测精度方面效果如何?
- RQ3从群体行为中提取的季节性特征在个体短周期系列上的预测性能提升程度如何?
- RQ4所提出的预处理流程是否能有效缓解电商需求预测中‘虚假零’和数据稀疏性的影响?
- RQ5在产品生命周期早期阶段,冷启动预测最为关键时,模型表现如何?
主要发现
- 基于XGBoost的全局模型在全量数据集上相比行业基准,将RMSE降低10%,MAE降低5%。
- 在产品生命周期早期阶段,模型显著优于基准,对于仅有10周历史数据的产品,RMSE降低42.5%,MAPE降低24.0%。
- 分类特征的序数编码始终优于哈希编码,表明其更有效地保留了特征结构。
- 引入季节性特征提升了整体性能,尤其对A类高销量产品(具有最高业务影响)提升显著。
- 该模型能够实现有效的冷启动预测,即使在历史数据极少的情况下也能保持强劲表现。
- 该框架对数据波动性和稀疏性表现出强鲁棒性,在所有产品类别(A、B和C)中均保持一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。