Skip to main content
QUICK REVIEW

[논문 리뷰] A multi-series framework for demand forecasts in E-commerce

Rémy Garnier, Arnaud Bellétoile|arXiv (Cornell University)|2019. 05. 31.
Forecasting Techniques and Applications참고 문헌 12인용 수 3
한 줄 요약

이 논문은 짧고 변동성이 큰 판매 시계열에서 정확도를 향상시키기 위해 교차 시리즈 정보와 비선형 관계를 활용하는 전역 XGBoost 기반 프레임워크를 제안한다. 계층적 제품 그룹화, 계절성 특징, 그리고 '가짜 제로'와 희소 데이터를 처리하기 위한 고도의 전처리를 통합함으로써, 최신 기준 대비 RMSE는 10% 감소하고 MAE는 5% 감소시키며, 신제품 초기 단계 예측에서 특히 두드러진 성능 향상을 이룬다.

ABSTRACT

Sales forecasts are crucial for the E-commerce business. State-of-the-art techniques typically apply only univariate methods to make prediction for each series independently. However, due to the short nature of sales times series in E-commerce, univariate methods don't apply well. In this article, we propose a global model which outperforms state-of-the-art models on real dataset. It is achieved by using Tree Boosting Methods that exploit non-linearity and cross-series information. We also proposed a preprocessing framework to overcome the inherent difficulties in the E-commerce data. In particular, we use different schemes to limit the impact of the volatility of the data.

연구 동기 및 목표

  • 짧고 변동성이 큰 이커머스 판매 시계열에서 역사적 데이터가 제한된 경우 단변량 모델이 실패하는 문제를 해결하기 위해.
  • 전역 모델링 접근법을 통해 관련된 제품 시리즈 간 정보 공유를 통해 예측 정확도를 향상시키기 위해.
  • 최소한의 역사적 데이터를 가진 신제품에 대해 그룹 수준의 패턴과 공변량을 활용해 콜드 스타트 예측을 가능하게 하기 위해.
  • '가짜 제로', 비정상성, 급격한 판매 폭증 등의 데이터 특화 문제를 맞춤형 전처리 파이프라인을 통해 극복하기 위해.
  • 실제 이커머스 데이터에서 프레임워크를 평가하고 산업 기준 및 최신 기술 대비 뛰어난 성능을 입증하기 위해.

제안 방법

  • 프레임워크는 모든 제품에 대해 전역적으로 수요 예측을 모델링하기 위해 XGBoost를 사용하며, 개별적이고 교차 시리즈 패턴을 모두 학습한다.
  • 세 가지 유형의 공변량을 통합한다: 시간적(예: 공휴일), 종단적(예: 제품 카테고리), 혼합형(예: 주간 가격)으로 특징 표현을 풍부하게 한다.
  • 계절성 특징은 유사 제품의 집합적 행동에서 유도되며, 개별적으로 짧은 시리즈에서도 강력한 추정이 가능하게 한다.
  • 전처리 파이프라인은 '가짜 제로'(예: 재고 부족으로 인한)를 식별하고, 비제로 판매 세그먼트에 대한 단변량 예측을 통해 보간한다.
  • 범주형 특징은 순서형 또는 해싱 인코딩을 통해 처리되며, 실험 결과 순서형 인코딩이 더 뛰어난 성능을 보였다.
  • 계층적 제품 그룹화와 시간적 특징을 갖춘 대규모 이커머스 데이터셋에서 엔드 투 엔드로 모델을 훈련시키며, 평가 지표로 RMSE와 MAE를 사용한다.

실험 결과

연구 질문

  • RQ1제품 시리즈 간 정보 공유를 통해 전역 부스팅 모델이 짧고 변동성이 큰 이커머스 판매 시계열에서 단변량 예측 방법을 능가할 수 있는가?
  • RQ2계층적 제품 그룹화와 교차 시리즈 정보의 활용이 역사적 데이터가 제한된 제품의 예측 정확도 향상에 얼마나 효과적인가?
  • RQ3그룹 수준 행동에서 유도된 계절성 특징이 개별 짧은 시리즈의 예측 성능 향상에 어느 정도 기여하는가?
  • RQ4제안된 전처리 파이프라인은 이커머스 수요 예측에서 '가짜 제로'와 데이터 희소성의 영향을 효과적으로 완화하는가?
  • RQ5제품의 초기 라이프사이클 단계에서, 콜드 스타트 예측이 가장 중요한 시점에 모델은 어떤 성능을 보이는가?

주요 결과

  • 전역 XGBoost 기반 모델은 전체 데이터셋에서 산업 기준 대비 RMSE를 10% 감소시키고 MAE를 5% 감소시켰다.
  • 제품의 역사적 데이터가 10주에 불과한 초기 라이프사이클 단계에서 모델은 기준 대비 RMSE를 42.5% 감소시키고 MAPE를 24.0% 감소시켜 뚜렷한 성능 향상을 보였다.
  • 범주형 특징의 순서형 인코딩은 해싱 인코딩보다 일관되게 뛰어난 성능을 보였으며, 특징의 구조가 더 잘 유지됨을 시사한다.
  • 계절성 특징을 통합함으로써 성능 향상이 이루어졌으며, 특히 사업 영향도가 가장 높은 그룹 A의 고용량 제품에서 두드러진 효과를 보였다.
  • 신제품에 대해 효과적인 콜드 스타트 예측이 가능해졌으며, 역사적 데이터가 극히 적은 상황에서도 뛰어난 성능을 달성했다.
  • 모델은 데이터의 변동성과 희소성에 대해 뛰어난 강건성을 보였으며, 모든 제품 카테고리(그룹 A, B, C)에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.