[논문 리뷰] Demand Forecasting using Long Short-Term Memory Neural Networks
이 논문은 100종의 빠르게 소비되는 소비재에 대해 단일변수 및 다변수 모델을 사용하여 전자식료품 소매에서 다단계 수요 예측을 위한 장기 기억망(LSTM) 네트워크를 평가한다. 다변수 LSTM은 식품 제품에 대해 벤치마크 모델을 능가했으며, 음료 제품에 대해서는 대부분의 벤치마크와 동등하거나 뛰어났다. 이는 제한된 데이터와 대체 또는 보완 효과를 포착하기 어려운 과제가 있음에도 불구하고, LSTM이 제품 수준의 수요 예측에 매우 적합하다는 것을 시사한다.
In this paper we investigate to what extent long short-term memory neural networks (LSTMs) are suitable for demand forecasting in the e-grocery retail sector. For this purpose, univariate as well as multivariate LSTM-based models were developed and tested for 100 fast-moving consumer goods in the context of a master's thesis. On average, the developed models showed better results for food products than the comparative models from both statistical and machine learning families. Solely in the area of beverages random forest and linear regression achieved slightly better results. This outcome suggests that LSTMs can be used for demand forecasting at product level. The performance of the models presented here goes beyond the current state of research, as can be seen from the evaluations based on a data set that unfortunately has not been publicly available to date.
연구 동기 및 목표
- 전자식료품 소매에서 제품 수준의 수요 예측에 대해 LSTM의 적합성을 평가하는 것.
- 통계적 및 기계학습 벤치마크와 비교하여 단일변수 및 다변수 LSTM 모델을 평가하는 것.
- 관련 시간열에 대한 사전학습과 다수의 제품을 동시에 예측하는 방식이 성능에 미치는 영향을 조사하는 것.
- 가격, 주중 여부, 매장 영업 여부와 같은 외생 변수가 예측 정확도 향상에 기여하는지 평가하는 것.
- 제한된 시간 범위를 가진 실제 전자식료품 데이터에서 기존 모델을 능가할 수 있는지 여부를 판단하는 것.
제안 방법
- 이전 수요 및 주중, 가격, 매장 영업 여부와 같은 외생 특징을 사용하여 단일변수 및 다변수 LSTM 모델을 개발하였다.
- 제품 별 복잡성에 맞추어 각 제품에 대해 네트워크 아키텍처(층 수 및 뉴런 수)를 최적화하기 위해 하이퍼파rameter 튜닝을 적용하였다.
- 유사한 시간열(중간 정도 이상의 스피어만 상관계수)을 가진 다른 창고의 관련 시간열에 대해 사전학습을 적용하여 일반화 능력을 향상시켰다.
- 다수의 제품을 동시에 예측하는 병렬 예측 방식을 구현하여 대체 또는 보완 제품 관계를 학습하도록 하였다.
- 다중 룩아웃에 걸쳐 mMAPE를 사용하여 모델 성능을 평가하고, 박스 플롯과 오차 분포를 통해 성능을 비교하였다.
- 자료 제약로 인해 두 달 간의 평가 윈도우를 사용하였으며, 전체 근무일 주에 대한 다단계 예측에 집중하였다.
실험 결과
연구 질문
- RQ1다변수 LSTM은 전자식료품 수요 예측에서 전통적인 통계적 및 기계학습 모델을 능가할 수 있는가?
- RQ2다른 창고의 관련 시간열에 대한 사전학습이 제한된 데이터에서 LSTM 성능을 향상시킬 수 있는가?
- RQ3다수의 제품을 동시에 예측하는 방식이 대체 또는 보완 제품 관계를 활용하여 예측 정확도를 향상시킬 수 있는가?
- RQ4가격 및 매장 영업 여부와 같은 외생 변수는 LSTM 예측 성능에 어떤 영향을 미치는가?
- RQ5모델 아키텍처는 제품 간에 얼마나 다를 수 있으며, 제품별 맞춤형 튜닝이 결과 향상에 기여하는가?
주요 결과
- 다변수 LSTM 모델은 식품 제품에 대해 다섯 가지 벤치마크 모델보다 평균적으로 뛰어난 성능을 보였으며, 이는 해당 카테고리에 매우 적합하다는 것을 시사한다.
- 음료 제품에 대해서는 다변수 LSTM이 선형 회귀와 랜덤 포레스트를 제외하고는 다섯 가지 벤치마크 중 세 개를 능가하였다.
- 24개의 음료 품목 중 11개에 대해 LSTM 모델이 가장 뛰어난 개별 제품 예측 성능을 기록했으며, 이는 시험한 제품의 약 45%에 해당한다.
- 박스 플롯 분석 결과, 식품 및 음료 모두에서 LSTM 모델의 제품 간 중앙값 오차는 모든 벤치마크 모델보다 낮았다.
- 층 수 및 뉴런 수 측면에서 모델 아키텍처가 제품 간에 크게 달라졌으며, 이는 제품별 하이퍼파rameter 튜닝이 유익할 수 있음을 시사한다.
- 이 데이터셋에서는 관련 시간열에 대한 사전학습이 성능 향상에 기여하지 않았지만, 시간 범위가 짧거나 자료가 흐린 환경에서는 유용할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.