[논문 리뷰] Application of data compression techniques to time series forecasting
이 논문은 데이터 압축과 예측 간 이론적 연관성을 활용하여 표준 손실 없는 데이터 압축 알고리즘—zlib, bzip2, PPM 등—을 예측 모델로 활용하는 새로운 시계열 예측 방법을 제안한다. 압축 기반 확률 추정과 다수의 압축기 조합의 가중 평균을 통해 경쟁력 있는 예측 정확도를 달성하였으며, T-index 및 Kp-index 시계열에 대한 1단계 예측에서 기존 기관인 호주 기상국과 SWPC를 능가한다.
In this study we show that standard well-known file compression programs (zlib, bzip2, etc.) are able to forecast real-world time series data well. The strength of our approach is its ability to use a set of data compression algorithms and "automatically" choose the best one of them during the process of forecasting. Besides, modern data-compressors are able to find many kinds of latent regularities using some methods of artificial intelligence (for example, some data-compressors are based on finding the smallest formal grammar that describes the time series). Thus, our approach makes it possible to apply some particular methods of artificial intelligence for time-series forecasting. As examples of the application of the proposed method, we made forecasts for the monthly T-index and the Kp-index time series using standard compressors. In both cases, we used the Mean Absolute Error (MAE) as an accuracy measure. For the monthly T-index time series, we made 18 forecasts beyond the available data for each month since January 2011 to July 2017. We show that, in comparison with the forecasts made by the Australian Bureau of Meteorology, our method more accurately predicts one value ahead. The Kp-index time series consists of 3-hour values ranging from 0 to 9. For each day from February 4, 2018 to March 28, 2018, we made forecasts for 24 values ahead. We compared our forecasts with the forecasts made by the Space Weather Prediction Center (SWPC). The results showed that the accuracy of our method is similar to the accuracy of the SWPC's method. As in the previous case, we also obtained more accurate one-step forecasts.
연구 동기 및 목표
- 일반적으로 이용 가능한 표준 데이터 압축 프로그램이 효과적인 시계열 예측 도구로 기능할 수 있는지 조사하기 위해.
- 실수 및 정수 값을 가지는 시계열에 대해 압축 기반 확률 추정 기법의 타당성을 탐색하기 위해.
- 실제 지구물리학적 시계열에서 앙상블 압축 방법의 성능을 기존의 확립된 예측 기준과 비교하기 위해.
- 현대 압축기들이 암묵적으로 잠재적인 규칙성을 탐지하기 위해 인공지능 유사 히وري스틱을 적용함으로써 예측에 적합한지 보여주기 위해.
제안 방법
- 압축 기반 확률 추정 공식을 사용: $ P_{\text{comp}}(x_{t+1}=a|x_{1}^{t}) = \frac{2^{-|\phi(x_{1}^{t}a)|}}{\sum_{b\in\mathcal{A}} 2^{-|\phi(x_{1}^{t}b)|}} $, 여기서 $ \phi $ 는 압축 함수이다.
- 가중치를 부여한 압축기 앙상블(zlib, PPM, bzip2)을 공식 $ P_{\phi}(x_{t+1}=a|x_{1}^{t}) = \frac{\sum_{i=1}^{k} \omega_i 2^{-|\phi_i(x_{1}^{t}a)|}}{\sum_{b\in\mathcal{A}} \sum_{i=1}^{k} \omega_i 2^{-|\phi_i(x_{1}^{t}b)|}} $ 을 통해 적용하며, $ \sum \omega_i = 1 $ 이다. 이는 동적으로 최고 성능을 내는 압축기를 선택하기 위해 사용된다.
- 실수 값을 가지는 데이터를 다루기 위해 시계열을 STL 분해를 통해 계절적 추세 제거, 스무딩, 1차 차분, 그리고 2~16개의 간격으로 양자화하는 전처리를 수행한다.
- 정확도를 향상시키기 위해 장기 예측 수준을 짧은 부분 수준(예: T-index의 경우 3단계씩 6개의 예측, Kp-index의 경우 8개의 예측)으로 분할한다.
- 정수 값을 가지는 목표 시계열과의 호환성을 확보하기 위해 실수 예측값을 정수로 반올림한 후 MAE를 계산한다.
실험 결과
연구 질문
- RQ1표준적인, 시장에서 구할 수 있는 데이터 압축 도구(zlib, bzip2, PPM 등)가 시계열 예측에 효과적으로 사용될 수 있는가?
- RQ2가중치를 부여한 앙상블 선택을 통해 다수의 압축 알고리즘을 조합하면 개별 압축기 대비 예측 정확도가 향상되는가?
- RQ3실제 지구물리학적 시계열(T-index 및 Kp-index 등)에 대해 압축 기반 예측 방식이 MAE 측면에서 기존의 확립된 방법과 비교해 어떻게 성능을 내는가?
- RQ4압축 기반 모델이 1단계 예측에서 기관에서 제공하는 예측(예: SWPC 또는 기상국)을 능가할 수 있는가?
주요 결과
- 2011년 1월~2017년 7월의 월간 T-index 시계열에 대해, 1단계 예측에서 압축 기반 방법이 호주 기상국보다 낮은 평균 절대 오차(MAE)를 기록하였으며, MAE = 11.3 vs. 12.2 로 나타났다.
- zlib + PPM + rp 앙상블을 사용한 방법은 1~4단계 예측에서 평균 MAE 15.0, 1~8단계 예측에서 18.3, 1~18단계 예측에서 23.1을 기록하였으며, SWS 예측보다 1단계 예측에서 뛰어난 성능을 보였다.
- 2018년 2월~2018년 3월의 Kp-index 시계열에 대해, zlib를 사용한 경우 1단계 MAE는 0.70, PPM를 사용한 경우 0.77이었으며, SWPC의 1.11보다 높은 정확도를 보였다. 이는 첫 번째 예측 단계에서의 우수성을 확인한다.
- zlib, PPM, 그리고 rp의 앙상블은 1단계 MAE 0.77을 기록하였으며, 이는 SWPC의 1.11보다 유의미하게 낮아 짧은 기간 예측에서 성능 향상을 확인하였다.
- 압축 기반 방법은 모든 예측 수준에서 경쟁 가능한 성능를 유지하였으며, 1~3단계 예측에서는 SWPC와 유사하거나 더 낮은 MAE를 기록하였다.
- 결과는 현대 압축기가 암묵적으로 인공지능 유사 히وري스틱을 적용하여 복잡한 시간적 패턴을 탐지함으로써, 명시적인 모델 설계 없이도 효과적인 예측이 가능하다는 것을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.