[논문 리뷰] Predicting Future Sales of Retail Products using Machine Learning
이 논문은 1C 회사에서 제공한 대규모 러시아 시계열 데이터셋을 사용하여 소매 판매 예측을 위해 XGBoost, LSTM 및 ARIMA를 평가한다. XGBoost가 둘 다를 능가하여 테스트 RMSE 0.878을 기록했으며, 이는 데이터셋 내 희소한 데이터 패턴을 효과적으로 처리하고 특징 공학을 잘 수행한 데 기인한다.
Techniques for making future predictions based upon the present and past data, has always been an area with direct application to various real life problems. We are discussing a similar problem in this paper. The problem statement is provided by Kaggle, which also serves as an ongoing competition on the Kaggle platform. In this project, we worked with a challenging time-series dataset consisting of daily sales data, kindly provided by one of the largest Russian software firms - 1C Company. The objective is to predict the total sales for every product and store in the next month given the past data. In order to perform forecasting for next month, we have deployed eXtreme Gradient Boosting (XGBoost) and Long Short Term Memory (LSTM) based network architecture to perform learning task. Root mean squared error (RMSE) between the actual and predicted target values is used to evaluate the performance, and make comparisons between the deployed algorithms. It has been found that XGBoost fared better than LSTM over this dataset which can be attributed to its relatively higher sparsity.
연구 동기 및 목표
- 이전 판매 데이터를 바탕으로 매월의 모든 제품-매장 조합에 대한 판매량을 예측하기 위해.
- 실제 소매 시계열 데이터셋에서 XGBoost, LSTM 및 ARIMA 모델의 성능을 비교하기 위해.
- 특징 공학, 특히 지연 특징과 범주형 인코딩의 영향을 모델 성능에 대해 평가하기 위해.
- F-스코어 중요도를 사용하여 XGBoost 모델에서 가장 영향력 있는 특징을 식별하기 위해.
- 딥 러닝(LSTM)과 전통적인 통계 모델(ARIMA)이 희소하고 고차원적인 소매 데이터에 적용 가능한지 탐색하기 위해.
제안 방법
- 검증 세트에서 그리드 서치를 통해 하이퍼파라미터 튜닝을 수행한 XGBoost를 적용하여 지연 특징, 범주형 인코딩을 사용하였다.
- 고정된(예: item_id, shop_id) 및 동적(예: item_count, price) 특징을 시간 단위로 동시에 처리하는 맞춤형 LSTM 아키텍처를 구현하였다.
- 유일한 제품-매장 조합마다 별도의 모델을 피팅하여 단변량 예측을 위해 ARIMA를 사용하였다.
- 학습, 검증 및 테스트 세트에서 주로 RMSE를 평가 지표로 사용하였다.
- 기상 분석(EDA) 및 데이터 정제를 광범위하게 수행하였으며, 타겟 값 클리핑 및 결측치 처리를 포함하였다.
- 학습률, 깊이, 정규화 및 배치 크기와 같은 하이퍼파라미터를 중심으로 XGBoost 및 LSTM의 하이퍼파라미터 튜닝을 랜덤 그리드 서치를 통해 수행하였다.
실험 결과
연구 질문
- RQ1XGBoost는 희소한 소매 판매 데이터 예측에서 딥 러닝(LSTM)과 고전적 통계 모델(ARIMA)을 능가하는가?
- RQ2지연 특징과 범주형 인코딩은 시계열 판매 예측에서 모델 성능에 어떤 영향을 미치는가?
- RQ3F-스코어로 측정된 특징 중요도는 XGBoost에서 입력 변수의 예측 능력을 얼마나 잘 반영하는가?
- RQ4맞춤형 LSTM 아키텍처는 소매 판매 환경에서 고정형 및 동적 특징을 효과적으로 모델링할 수 있는가?
- RQ5하이퍼파라미터 튜닝은 다양한 모델에서 최적의 성능을 달성하는 데 어떤 역할을 하는가?
주요 결과
- XGBoost는 테스트 RMSE 0.878을 기록하여 LSTM(0.924) 및 ARIMA(1.093)를 모두 앞섰다.
- XGBoost 모델은 학습 및 검증 RMSE 간의 변동이 적었으며(0.764 대 0.807), 안정적인 일반화 성능을 보였다.
- 지연된 타겟 특징(예: target_item_lag_1)이 가장 중요한 예측 변수였으며, F-스코어는 3034였다.
- XGBoost에서 가장 중요한 다섯 가지 특징은 item_id(4168), target_item_lag_1(3034), enc_shop_id_category(2845), item_category(2738), date_block_num(2515)였다.
- LSTM는 더 철저한 하이퍼파라미터 튜닝이 필요했으며, 아키텍처 커스터마이제이션에도 불구하고 이 데이터셋에서는 XGBoost에 뒤지지 않았다.
- ARIMA는 세 모델 중에서 가장 성능이 열 劣했으며, 테스트 RMSE 1.093를 기록하여 다변량이고 희소한 소매 데이터 처리에 한계를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.