[논문 리뷰] Applying k-nearest neighbors to time series forecasting : two new approaches
이 논문은 시계열 예측을 위한 두 가지 새로운 k-최근접 이웃(k-NN) 접근법인 가중 근접 이웃에서의 고전적 파rameter 조정(CPTO-WNN)과 가중 근접 이웃에서의 빠른 파rameter 조정(FPTO-WNN)을 제안한다. CPTO-WNN은 가장 최근의 부분수열를 동일 길이의 모든 과거 부분수열과 비교하여 이웃을 선정하는 반면, FPTO-WNN은 계산 비용을 낮추기 위해 검색 공간을 축소한다. 두 방법 모두 최적의 k와 특징 선택을 위해 교차검증 기반의 조정 과정을 사용하며, 실제 미국 소매 및 영국 우유 생산 데이터에서 SARIMA, 홀트-윈터스, ETS 모델보다 뛰어난 정확도를 보였다.
K-nearest neighbors algorithm is one of the prominent techniques used in classification and regression. Despite its simplicity, the k-nearest neighbors has been successfully applied in time series forecasting. However, the selection of the number of neighbors and feature selection is a daunting task. In this paper, we introduce two methodologies to forecasting time series that we refer to as Classical Parameters Tuning in Weighted Nearest Neighbors and Fast Parameters Tuning in Weighted Nearest Neighbors. The first approach uses classical parameters tuning that compares the most recent subsequence with every possible subsequence from the past of the same length. The second approach reduces the neighbors' search set, which leads to significantly reduced grid size and hence a lower computational time. To tune the models' parameters, both methods implement an approach inspired by cross-validation for weighted nearest neighbors. We evaluate the forecasting performance and accuracy of our models. Then, we compare them to some classical approaches, especially, Seasonal Autoregressive Integrated Moving Average, Holt-Winters and Exponential Smoothing State Space Model. Real data examples on retail and food services sales in the USA and milk production in the UK are analyzed to demonstrate the application and the efficiency of the proposed approaches.
연구 동기 및 목표
- 시계열 예측에서 k-NN의 최적 k와 특징 선택 문제에 도전하며, 이는 모델 성능에 큰 영향을 미친다.
- 정확도를 희생시키지 않은 채로 k-NN 기반 예측의 계산 부담을 줄이기 위해 이웃 검색 집합을 제한한다.
- 교차검증 기반 접근법을 사용하여 가중 k-NN 모델에 대한 자동화되고 강력한 파rameter 조정 절차를 개발한다.
- 실제 데이터셋에서 전통적인 시계열 모델인 SARIMA, 홀트-윈터스, ETS와 제안된 방법을 비교 평가한다.
- 다양한 시계열 데이터, 특히 소매 매출 및 우유 생산 데이터에서 제안된 방법의 효과성과 효율성을 입증한다.
제안 방법
- CPTO-WNN은 가장 최근 부분수열를 동일 길이의 가능한 모든 과거 부분수열와 비교하여 k-최근접 이웃을 식별한다.
- FPTO-WNN은 계산 시간을 크게 줄이기 위해 이웃 검색 집합을 축소하면서도 예측 정확도를 유지한다.
- 두 방법 모두 최적의 이웃 수(k)와 관련 특징을 선택하기 위해 평균 오차를 최소화하는 방식으로 수정된 교차검증 기법을 사용한다.
- 예측은 k-최근접 부분수열의 다음 값들의 가중 평균에 기반하며, 가중치는 거리의 역수에 비례한다.
- 특징 선택은 성능 향상을 위해 정보가 풍부한 부분수열에 집중하기 위해 조정 과정에 통합된다.
- 이 방법들은 미국 소매 및 식품 서비스 매출 및 영국 젖소 우유 생산 데이터셋에 적용되었으며, 주로 MAPE를 정확도 지표로 사용하였다.
실험 결과
연구 질문
- RQ1k와 특징 선택 최적화를 통해 체계적인 파arameter 조정 접근법이 시계열 예측에서 k-NN 성능을 향상시킬 수 있는가?
- RQ2k-NN에서 전체 이웃 검색의 계산 비용은 확장성에 어떤 영향을 미치며, 정확도를 훼손하지 않고 이를 줄일 수 있는가?
- RQ3제안된 CPTO-WNN과 FPTO-WNN 방법은 SARIMA, 홀트-윈터스, ETS와 같은 전통적 모델과 비교해 정확도와 효율성 면에서 어떻게 다른가?
- RQ4제안된 교차검증 기반 조정 절차는 기본 설정이나 히우리스틱 기반 파arameter 선택보다 항상 더 나은 예측 결과를 도출하는가?
- RQ5예측 수준이 증가함에 따라 모델 성능은 어떻게 변화하며, 어느 방법이 더 긴 예측 수준에서도 안정성을 유지하는가?
주요 결과
- 미국 소매 및 식품 서비스 매출 데이터에서 CPTO-WNN은 다양한 예측 수준에서 MAPE 측면에서 FPTO-WNN, SARIMA, 홀트-윈터스, ETS를 모두 능가한다.
- 영국 우유 생산 데이터셋에서는 CPTO-WNN과 FPTO-WNN이 모든 예측 수준에서 SARIMA, 홀트-윈터스, ETS를 크게 능가하며, FPTO-WNN은 가장 낮은 계산 비용을 보였다.
- 미국 소매 데이터의 경우, CPTO-WNN은 수준 7에서 가장 낮은 MAPE(1.285574)를 기록했고, FPTO-WNN은 1.371099를 기록했으며, ETS(1.519837)와 SARIMA(1.588464)를 모두 뛰어넘었다.
- 홀트-윈터스 방법은 미국 소매 데이터에서 수준 1과 2에서 수렴하지 못했으며, 이는 제안된 조정 프레임워크 하에서의 불안정성을 시사한다.
- 예측 수준이 증가함에 따라 모든 모델에서 MAPE가 증가하지만, CPTO-WNN과 FPTO-WNN은 전통적 모델보다 유의미하게 낮은 오차율을 유지한다.
- FPTO-WNN은 이웃 검색 공간을 줄였기 때문에 CPTO-WNN보다 계산적으로 더 효율적이며, 대규모 또는 실시간 응용에 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.