Skip to main content
QUICK REVIEW

[논문 리뷰] Timer: Generative Pre-trained Transformers Are Large Time Series Models

Yong Liu, Haoran Zhang|arXiv (Cornell University)|2024. 02. 04.
Time Series Analysis and Forecasting인용 수 4
한 줄 요약

이 논문은 10억 개의 시간 포인트를 하나의 단일 시리즈 시퀀스(S3) 형식으로 통합하여 사전 훈련한 대규모 디코더 전용 트랜스포머 모델인 Timer를 소개한다. 이는 시간 시리즈 예측, 보간, 이상 탐지 등 다양한 작업에 소수의 예시로도 일반화할 수 있도록 한다. GPT 스타일의 자동회귀 목표를 채택함으로써, 최소한의 미세조정으로도 최신 기술 수준의 성능을 달성하며, 저자료 환경에서 뛰어난 확장성과 작업 일반성(Generalization)을 입증한다.

ABSTRACT

Deep learning has contributed remarkably to the advancement of time series analysis. Still, deep models can encounter performance bottlenecks in real-world data-scarce scenarios, which can be concealed due to the performance saturation with small models on current benchmarks. Meanwhile, large models have demonstrated great powers in these scenarios through large-scale pre-training. Continuous progress has been achieved with the emergence of large language models, exhibiting unprecedented abilities such as few-shot generalization, scalability, and task generality, which are however absent in small deep models. To change the status quo of training scenario-specific small models from scratch, this paper aims at the early development of large time series models (LTSM). During pre-training, we curate large-scale datasets with up to 1 billion time points, unify heterogeneous time series into single-series sequence (S3) format, and develop the GPT-style architecture toward LTSMs. To meet diverse application needs, we convert forecasting, imputation, and anomaly detection of time series into a unified generative task. The outcome of this study is a Time Series Transformer (Timer), which is generative pre-trained by next token prediction and adapted to various downstream tasks with promising capabilities as an LTSM. Code and datasets are available at: https://github.com/thuml/Large-Time-Series-Model.

연구 동기 및 목표

  • 소규모 모델이 자료가 부족한 시간 시리즈 환경에서 성능에 한계를 보이는 문제를 해결하기 위해, 강력한 소수의 예시 일반화 능력을 지닌 대규모 시간 시리즈 모델(LTSM)을 개발한다.
  • 시간 시리즈 분야에 확장 가능한 통합 아키텍처와 사전 훈련 전략의 부재를 해결하여, 대규모 언어 모델의 성공을 모방한다.
  • 예측, 보간, 이상 탐지 등 다양한 시간 시리즈 작업을 동일한 생성 모델링 프레임워크로 통합하여, 동일한 모델과 훈련 목표로 처리한다.
  • 다양한 도메인에서 구성된 10억 개의 시간 포인트를 포함하는 대규모 다중 도메인 데이터셋(UTSD)을 구축하여, 강력한 사전 훈련과 확장성 연구를 가능하게 한다.
  • 자기회귀적 다음 토큰 예측 방식으로 훈련된 디코더 전용 트랜스포머가 시간 시리즈 분석에서 뛰어난 확장성과 작업 일반성(Generalization)을 달성할 수 있음을 입증한다.

제안 방법

  • 다양한 도메인에서 유래한 10억 개의 시간 포인트를 포함하는 통합 시간 시리즈 데이터셋(UTSD)을 정제하여 확장 가능한 사전 훈련을 가능하게 하였다.
  • 이질적인 시간 시리즈를 표준화된 토큰 시퀀스 형식으로 통합하기 위해 단일 시리즈 시퀀스(S3) 형식을 제안하였다.
  • GPT 스타일의 사전 훈련을 모방하기 위해 자기회귀적 다음 토큰 예측 방식으로 훈련되는 디코더 전용 트랜스포머 아키텍처를 설계하였다.
  • 예측, 보간, 이상 탐지 작업을 하나의 생성 작업으로 통합하여, 제로샷 및 소수의 예시 적응을 가능하게 하였다.
  • 사전 훈련 단계에서 마스킹 및 대비 목표를 활용한 데이터 중심의 사전 훈련을 수행한 후, 하류 작업에 대해 미세조정을 적용하였다.
  • 모델 크기와 사전 훈련 데이터 크기를 확장하여 모델의 스케일링 법칙을 검증하였으며, 일관된 성능 향상을 확인하였다.

실험 결과

연구 질문

  • RQ1자기회귀적 생성 방식을 통한 대규모 시간 시리즈 모델 사전 훈련이 저자료 환경에서 강력한 소수의 예시 일반화 능력을 달성할 수 있는가?
  • RQ2GPT 스타일로 훈련된 디코더 전용 트랜스포머 아키텍처가 시간 시리즈 작업에서 인코더 전용 모델보다 우수한 성능을 보일 수 있는가?
  • RQ3통합된 생성 프레임워크가 예측, 보간, 이상 탐지 등 다양한 시간 시리즈 작업을 하나의 모델로 효과적으로 처리할 수 있는가?
  • RQ4모델 크기와 데이터 크기의 확장이 시간 시리즈 모델링 성능에 미치는 영향은 무엇이며, 대규모 시간 시리즈 모델에 대해 스케일링 법칙이 성립하는가?
  • RQ5표준화된 S3 형식이 이질적인 시간 시리즈 데이터를 확장 가능한 대규모 사전 훈련을 위해 통합할 수 있는가?

주요 결과

  • Timer는 훈련 데이터의 5%만으로도 예측, 보간, 이상 탐지 작업에서 최신 기술 수준의 성능을 달성하며, 기존 모델들을 능가한다.
  • PEMS03 데이터셋에서 훈련 샘플의 5%만을 사용할 경우, 12G 사전 훈련을 통해 MSE를 기준선의 0.188에서 0.125로 감소시켜 강력한 소수의 예시 일반화 능력을 입증하였다.
  • 20%의 훈련 데이터를 사용했을 때, PEMS08에서 기준선 모델 대비 MSE에서 상대적 25% 향상을 달성하여 확장성의 우수성을 입증하였다.
  • GPT 스타일의 사전 훈련 방식을 적용한 디코더 전용 아키텍처가 특히 저자료 환경에서 인코더 전용 모델보다 뛰어난 성능을 보였다.
  • 모델 크기를 4G에서 12G 파라미터로 확장함으로써 PEMS03에서 5% 데이터 조건에서 MSE를 30% 감소시켜 시간 시리즈 분야에서 스케일링 법칙의 타당성을 확인하였다.
  • 시각화 결과는 Timer가 보간 시 누락된 값을 정확히 생성하고, 예측 시 미래 시퀀스를 예측하며, 이상 탐지 시 분포를 이탈한 출력을 생성함으로써 이상을 탐지함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.