[논문 리뷰] Comparing statistical and machine learning methods for time series forecasting in data-driven logistics -- A simulation study
이 시뮬레이션 연구는 물류 분야의 한 단계 예측에 대해 통계적(ARIMA, TBATS) 및 기계학습(랜덤 포레스트, XGBoost) 방법을 비교한다. 다양한 복잡도를 가진 합성 데이터를 사용하여, 비선형성 또는 점프 영향을 받는 설정에서는 특히 차분 처리된 데이터를 사용한 기계학습 방법이 전통적 모델을 능가하는 것으로 나타났으며, 선형 또는 랜덤 워크 설정에서는 양쪽 접근 방식이 유사하게 성능를 보였다.
Many planning and decision activities in logistics and supply chain management are based on forecasts of multiple time dependent factors. Therefore, the quality of planning depends on the quality of the forecasts. We compare various forecasting methods in terms of out of the box forecasting performance on a broad set of simulated time series. We simulate various linear and non-linear time series and look at the one step forecast performance of statistical learning methods.
연구 동기 및 목표
- 통계적 및 기계학습 방법의 물류 관련 시계열에서의 즉각적인 예측 성능을 평가하고 비교하기.
- 선형, 비선형, 점프 또는 랜덤 워크를 포함한 다양한 데이터 생성 과정이 예측 정확도에 미치는 영향을 조사하기.
- 특히 차분 처리와 같은 데이터 전처리가 기계학습 모델 성능에 미치는 영향을 평가하기.
- 데이터 특성과 복잡성에 따라 예측 방법을 선택하는 데 실용적 지침을 제공하기.
- 기계학습 방법이 물류 적용 분야에서 전통적 시계열 모델을 크게 능가하는 조건을 규명하기.
제안 방법
- AR, BL, SAR, NAR, NMA, STAR, TAR 모델을 포함한 15개의 고유한 시계열 데이터 생성 과정을 시뮬레이션하였으며, 추가적인 복잡성 유무를 고려하여 설정.
- 사용된 예측 방법은 (계절성 있는) ARIMA, TBATS, 랜덤 포레스트, XGBoost이며, 모두 한 단계 앞선 예측을 사용.
- 일관된 평가를 위해 학습 및 예측에 창문 크기가 8인 슬라이딩 윈도우 방식을 적용.
- 표본 크기(100에서 500까지)에 따라 평균 제곱오차(MSE)를 사용하여 성능을 평가하였으며, 각 설정당 100회의 반복을 실시.
- 기계학습 모델에 대해 데이터 차분 처리를 적용하여, 비정상성 또는 복잡한 설정에서의 예측 정확도에 미치는 영향을 평가.
- 비선형성, 점프, 랜덤 노이즈의 영향을 분리하기 위해 통제된 데이터 구조를 가진 종합적인 시뮬레이션 프레임워크를 구축.
실험 결과
연구 질문
- RQ1기계학습 방법(랜덤 포레스트, XGBoost)이 전통적 시계열 모델(ARIMA, TBATS)을 초월하는 데이터 생성 과정은 무엇인가?
- RQ2차분 처리가 복잡한 시계열 설정에서 트리 기반 기계학습 모델의 예측 성능에 어떤 영향을 미치는가?
- RQ3복합적인 복잡성(예: 복합 포아송 점프 또는 랜덤 워크)이 통계적 및 기계학습 방법의 예측 정확도에 어떤 영향을 미치는가?
- RQ4어떤 조건에서 시계열 모델이 기계학습 모델을 능가하거나 동등하게 성능을 내는가?
- RQ5시간 길이와 데이터 복잡성에 따라 기계학습 모델과 통계적 모델 간의 성능 격차가 체계적으로 변화하는가?
주요 결과
- 합성 포아송 점프 과정이 포함된 설정에서는, 특히 시간 길이가 500으로 증가함에 따라, 차분 처리된 랜덤 포레스트가 모든 다른 방법보다 뛰어난 성능를 보였다.
- 랜덤 워크 성분이 포함된 데이터에서는 MSE 값이 시간 길이 증가에 따라 상대적으로 안정되거나 약간 감소하였으며, 차분 처리된 기계학습 방법이 비차분 버전보다 성능 향상을 보였다.
- 선형적이고 안정적인 설정(예: AR, BL2)에서는 시계열 모델가 약간 더 우수하거나 기계학습 방법과 유사한 성능를 보였으며, MSE 차이가 미미했다.
- 비선형 설정(예: NAR1, NAR2, STAR1, TAR1)에서는 기계학습 방법의 결과가 혼합된 경향이 있었으며, 랜덤 포레스트는 XGBoost를 능가했지만, 일부 경우에서는 시계열 모델가 둘 다를 능가했다.
- 점프 과정이 포함된 경우, 모든 방법에서 MSE가 단조롭게 증가하였으며, 시간 길이 500일 경우 MSE 값이 2000을 초과하여 구조적 붕괴에 매우 민감함을 시사했다.
- 비선형성 및 복잡한 설정에서 데이터 차분 처리가 기계학습 모델의 성능을 크게 향상시켰으며, 이는 기계학습 성공을 위한 전처리의 중요성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.