[논문 리뷰] Demand Prediction Using Machine Learning Methods and Stacked Generalization
이 논문은 동일한 제품을 다른 가격으로 경쟁하는 판매자들이 존재하는 터키 온라인 쇼핑 플랫폼에서 수요 예측을 위한 스태킹(스택킹) 앙상블 모델을 제안한다. 기울기 부스팅, 랜덤 포레스트, 선형 회귀, 결정 트리와 같은 다수의 기계학습 회귀 모델을 결합함으로써, 최상의 구성(GBT + RF + LR)에서 RMSE가 1.864로 감소하여 개별 모델을 능가하며, 더 적은 학습 데이터로도 통계적으로 유의미한 성능 향상을 보였다.
Supply and demand are two fundamental concepts of sellers and customers. Predicting demand accurately is critical for organizations in order to be able to make plans. In this paper, we propose a new approach for demand prediction on an e-commerce web site. The proposed model differs from earlier models in several ways. The business model used in the e-commerce web site, for which the model is implemented, includes many sellers that sell the same product at the same time at different prices where the company operates a market place model. The demand prediction for such a model should consider the price of the same product sold by competing sellers along the features of these sellers. In this study we first applied different regression algorithms for specific set of products of one department of a company that is one of the most popular online e-commerce companies in Turkey. Then we used stacked generalization or also known as stacking ensemble learning to predict demand. Finally, all the approaches are evaluated on a real world data set obtained from the e-commerce company. The experimental results show that some of the machine learning methods do produce almost as good results as the stacked generalization method.
연구 동기 및 목표
- 경쟁하는 판매자들이 동일한 제품을 다른 가격으로 제공하는 마켓플레이스 전자상거래 모델에서 수요 예측의 과제를 해결하기 위해.
- 개별 기계학습 모델과 비교하여 스태킹 일반화가 수요 예측 정확도를 향상시키는지 평가하기 위해.
- 다양한 회귀 모델을 사용한 앙상블 학습이 더 적은 학습 데이터로 예측 오차를 줄일 수 있는지 확인하기 위해.
- 실제 전자상거래 환경에서 수요 예측을 위한 최적의 기본 학습기와 메타-학습기 조합을 규명하기 위해.
제안 방법
- 1단계 회귀 모델(선형 회귀, 랜덤 포레스트, 기울기 부스팅, 결정 트리)을 학습 데이터에 대해 훈련하고, 그 예측을 조합하는 2단계 학습을 수행하는 스태킹(스택킹) 일반화를 적용하였다.
- 1단계 모델 최적화를 위해 훈련 세트에서 10겹 교차 검증을 사용하였으며, 검증 세트를 사용해 메타-학습기를 훈련시켰다.
- 데이터를 50% 훈련, 20% 검증, 30% 테스트 세트로 분할하였으며, 안정적인 평가를 위해 20번의 랜덤 분할을 수행하였다.
- RMSE를 사용해 모델 성능을 평가하였고, 성능 차이의 통계적 유의성을 평가하기 위해 ANOVA와 t-검정을 적용하였다.
- 이중 조합과 삼중 조합을 포함한 다양한 1단계 모델 조합과 다양한 메타-학습기(예: 선형 회귀, 결정 트리)를 테스트하여 최적의 구성 조합을 도출하였다.
- 동일한 제품을 다른 가격으로 판매하는 여러 판매자가 존재하는 n11.com의 실제 전자상거래 데이터를 사용하였다.
실험 결과
연구 질문
- RQ1가격 경쟁이 존재하는 전자상거래 마켓플레이스에서, 스태킹 일반화가 개별 기계학습 모델과 비교해 수요 예측 정확도를 향상시킬 수 있는가?
- RQ2선형 회귀, 랜덤 포레스트, 기울기 부스팅, 결정 트리 중 어떤 기본 학습기 조합이 수요 예측에서 가장 낮은 예측 오차를 낳는가?
- RQ3단일 모델보다 더 적은 학습 데이터로 스태킹 모델이 더 뛰어난 성능을 내는가?
- RQ4스태킹 모델의 성능 향상은 개별 모델과 비교해 통계적으로 유의미한가?
주요 결과
- 기울기 부스팅, 랜덤 포레스트, 선형 회귀를 1단계 학습기로 사용한 스태킹 일반화 모델이 테스트 세트에서 가장 낮은 RMSE 1.864를 기록하였다.
- 기울기 부스팅과 랜덤 포레스트의 이중 조합이 가장 우수한 단일 이중 조합으로서 RMSE 1.870을 기록하였다.
- 2단계에서 선형 회귀를 사용한 메타-학습기가 결정 트리나 랜덤 포레스트와 같은 다른 메타-학습기보다 우수한 성능을 보였다.
- ANOVA 결과에서 유의수준 5%에서 귀무가설을 기각하였으며, 이는 모델 간 성능 차이가 통계적으로 유의미하다는 것을 의미한다.
- t-검정 결과, 랜덤 포레스트(1단계)와 선형 회귀(2단계) 모델 간 성능에 통계적으로 유의미한 차이가 없었으며, 이는 앙상블 접근법의 안정성을 시사한다.
- 제안된 스태킹 모델은 개별 모델과 유사한 성능을 달성하면서도 훈련 데이터의 20%만으로도 가능했으며, 이는 데이터 효율성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.