[논문 리뷰] High-dimensional Time Series Prediction with Missing Values
이 논문은 높은 차원의 시계열 데이터에서 결측치가 존재하는 상황에서도 데이터 기반의 시간적 종속성 학습을 행렬 분해에 통합하는 새로운 프레임워크인 시간적 정규화 행렬 분해(Temporal Regularized Matrix Factorization, TRMF)를 제안한다. 시간적 상관관계를 학습된 전이 행렬을 통해 모델링하고 저랭크 분해를 활용함으로써, 실제 및 시뮬레이션 데이터셋에서 예측 및 결측치 보정 분야에서 최신 기술 수준의 성능을 달성한다. 기존의 고전적 및 기존의 행렬 분해 방법들보다 뛰어나다.
High-dimensional time series prediction is needed in applications as diverse as demand forecasting and climatology. Often, such applications require methods that are both highly scalable, and deal with noisy data in terms of corruptions or missing values. Classical time series methods usually fall short of handling both these issues. In this paper, we propose to adapt matrix matrix completion approaches that have previously been successfully applied to large scale noisy data, but which fail to adequately model high-dimensional time series due to temporal dependencies. We present a novel temporal regularized matrix factorization (TRMF) framework which supports data-driven temporal dependency learning and enables forecasting ability to our new matrix factorization approach. TRMF is highly general, and subsumes many existing matrix factorization approaches for time series data. We make interesting connections to graph regularized matrix factorization methods in the context of learning the dependencies. Experiments on both real and synthetic data show that TRMF outperforms several existing approaches for common time series tasks.
연구 동기 및 목표
- 고전적 시계열 모델이 높은 차원, 대규모 데이터에서 결측치를 처리하는 데에 한계를 보이는 문제를 해결하기 위해.
- 시간적 종속성을 포착할 수 있는 확장 가능한 행렬 분해 프레임워크를 개발하기 위해.
- 완전한 데이터가 필요 없이도 고차원 시계열 데이터에서 효과적인 예측 및 결측치 보정을 가능하게 하기 위해.
- 학습 가능한 시간적 동역학을 통합함으로써 기존의 행렬 분해 및 그래프 정규화 접근법을 일반화하기 위해.
제안 방법
- TRMF는 시계열 예측 문제를 저랭크 행렬 분해 문제로 공식화하며, 데이터 행렬 $ Y \in \mathbb{R}^{n \times T} $ 를 $ Y \approx FX $ 로 모델링한다. 여기서 $ F $ 는 시계열 고유의 특징을, $ X $ 는 시간에 따라 변화하는 잠재 상태를 나타낸다.
- 기존 방법에서 사용하는 고정되거나 비정형의 정규화 항과는 달리, 시간적 종속성을 학습된 전이 행렬 $ M_\Theta $ 를 통해 모델링하기 위해 시간 정규화 항을 도입한다.
- 정규화된 목적 함수를 최적화한다: $ \min_{F,X} \sum_{(i,t) \in \Omega} (Y_{it} - \mathbf{f}_i^\top \mathbf{x}_t)^2 + \lambda_f \mathcal{R}_f(F) + \lambda_x \mathcal{R}_x(X) $, 여기서 $ \Omega $ 는 관측된 항목을 나타낸다.
- 시간 정규화 항 $ \mathcal{R}_x(X) $ 는 시간 역학을 캡처하는 학습된 전이 행렬에 기반하며, 사전 정의된 그래프에 의존하지 않고 데이터 기반의 종속성 학습을 가능하게 한다.
- 학습된 잠재 역학을 활용하여 미래 시간대를 예측하거나 결측 항목을 재구성함으로써, TRMF는 예측과 보정을 모두 지원한다.
- 다양한 정규화 항 설정 하에서 AR 모델과 그래프 정규화 행렬 분해를 특수 케이스로 포함함으로써, 몇 가지 기존 방법들을 일반화한다.
실험 결과
연구 질문
- RQ1고차원 시계열 데이터에서 결측치가 존재하는 상황에서 행렬 분해를 효과적으로 시간적 종속성을 모델링하는 데로 확장할 수 있는가?
- RQ2고정되거나 그래프 기반의 구조에 의존하지 않고 데이터로부터 시간적 종속성을 학습할 수 있는가?
- RQ3행렬 분해에 데이터 기반의 시간 정규화 항을 도입하면 고전적 시계열 모델에 비해 예측 및 결측치 보정 정확도가 향상되는가?
- RQ4TRMF는 Walmart 매출 또는 전기 소비와 같은 실생활 대규모 시계열 데이터셋에서 결측치가 존재하는 상황에서도 확장 가능한가?
주요 결과
- 전기 및 교통 데이터셋에서 24시간 전방 예측에서 TRMF-AR가 SVD-AR(1), DLM, TCF와 비교해 낮은 RMSE로 모든 경쟁 방법들보다 뛰어난 성능을 보였다.
- Walmart-1 데이터셋에서 TRMF는 테스트 RMSE가 1.239로, DLM(1.453) 및 TCF(1.320)보다 유의미하게 낮았다.
- 결측치 보정 분야에서 TRMF는 모든 테스트 데이터셋과 결측치 수준에서 가장 낮은 RMSE를 기록했으며, 교통 데이터에서 50% 결측일 경우 RMSE가 0.184로 DLM(0.224) 및 TCF(0.193)를 모두 앞섰다.
- TRMF는 대규모 데이터에서 확장 가능하고 안정적이며, R-DLM는 $ n \geq 32 $ 에서 실행에 실패함으로써 TRMF가 실생활 응용에서 실질적인 이점을 지닌다.
- TRMF는 기존 방법을 일반화하며, AR 모델과 그래프 정규화 행렬 분해를 다양한 정규화 설정 하에서 특수 케이스로 포함함으로써 그 유연성과 이론적 기반을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.