Skip to main content
QUICK REVIEW

[논문 리뷰] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting

Kashif Rasul, Arjun Ashok|arXiv (Cornell University)|2023. 10. 12.
Stock Market Forecasting Methods인용 수 32
한 줄 요약

Lag-Llama은 단변량 확률 시계열 예측을 위한 디코더-전용 트랜스포머 기초 모델로, 대규모 다양성 코퍼스로 사전학습되었으며, 보이지 않는 데이터셋에서 강한 제로샷 일반화와 최첨단 소수샷 미세조정 성능을 보인다.

ABSTRACT

Over the past years, foundation models have caused a paradigm shift in machine learning due to their unprecedented capabilities for zero-shot and few-shot generalization. However, despite the success of foundation models in modalities such as natural language processing and computer vision, the development of foundation models for time series forecasting has lagged behind. We present Lag-Llama, a general-purpose foundation model for univariate probabilistic time series forecasting based on a decoder-only transformer architecture that uses lags as covariates. Lag-Llama is pretrained on a large corpus of diverse time series data from several domains, and demonstrates strong zero-shot generalization capabilities compared to a wide range of forecasting models on downstream datasets across domains. Moreover, when fine-tuned on relatively small fractions of such previously unseen datasets, Lag-Llama achieves state-of-the-art performance, outperforming prior deep learning approaches, emerging as the best general-purpose model on average. Lag-Llama serves as a strong contender to the current state-of-art in time series forecasting and paves the way for future advancements in foundation models tailored to time series data.

연구 동기 및 목표

  • 다양한 도메인에서 제로샷 및 소수 샷 전이를 가능하게 하기 위해 확률적 시계열 예측에 대한 기초 모델의 사용을 촉진한다.
  • 디코더-전용 트랜스포머 내에서 랙 공변량(lag covariates)을 활용하는 간단하고 확장 가능한 아키텍처를 개발한다.
  • 주변 단변량 시계열의 크고 다양한 코퍼스에서 사전학습하여 주파수 및 도메인 간 일반화 특성을 연구한다.
  • 강력한 베이스라인과 비교하여 보이지 않는 다운스트림 데이터셋에 대한 제로샷, 미세조정 및 소수샷 적응을 평가한다.

제안 방법

  • Lag 기반 토크나이제이션과 공변량을 가진 디코더-전용 트랜스포머를 사용한다( LLaMA에서 영감을 받음 ).
  • 지정된 랙 인덱스 집합과 날짜-시간 공변량을 이용해 lag 특성을 구성한다.
  • 확률 분포의 매개변수( Student's t )를 출력하도록 분포 헤드를 통해 학습한다.
  • 스케일링을 위해 각 시계열의 요약 공변량(평균, 표준편차)과 함께 중위수와 IQR로 견고한 표준화를 적용한다.
  • 6개 도메인에 걸친 7,965개 시계열(~352백만 창)에서 사전학습; 보이지 않는 데이터셋에서 검증 손실을 기반으로 조기 중지로 미세조정.
  • 자가회귀 샘플링을 통해 예측 분포를 생성하고 CRPS를 계산하여 평가; 제로샷 및 소수샷 성능을 보고한다.

실험 결과

연구 질문

  • RQ1다양한 시계열에서 사전학습된 기초 모델이 다운스트림 미세조정 없이 보이지 않는 데이터셋에 얼마나 잘 일반화할 수 있는가(제로샷)?
  • RQ2보이지 않는 데이터셋에서 미세조정한 Lag-Llama의 성능은 어떠하며, 데이터세트 특화 모델 및 다른 범용 모델과 비교하면 어떻게 되는가?
  • RQ3새로운 도메인에서 이력이 제한된 경우 Lag-Llama가 소수샷 regime에서 효과적으로 적응할 수 있는가?
  • RQ4사전학습 코퍼스의 다양성과 크기가 Lag-Llama의 예측 성능과 확장성에 어떻게 영향을 미치는가?

주요 결과

  • Lag-Llama은 보이지 않는 데이터셋에서 경쟁력 있는 제로샷 성능을 보이며(데이터세트 간 평균 CRPS 순위 6.714).
  • 미세조정된 Lag-Llama는 여러 데이터셋에서 최첨단 성능을 달성하고 비교 방법 중 최적의 평균 순위(2.786)를 달성한다.
  • 다양한 데이터에서 처음부터 사전학습될 때 많은 베이스라인(Informer, AutoFormer, ETSFormer 등을 포함)보다 강력한 범용 모델로서 우수한 성능을 보인다.
  • 이력의 가용 범위가 20–80%로 달라지는 소수샷 설정에서 Lag-Llama은 일관되게 강력한 적응을 제공하며, 이력이 증가할수록 성능이 향상되어 종종 베이스라인을 능가한다.
  • Lag-Llama은 보이지 않는 주파수와 도메인을 처리할 수 있으며, 일부 도메인(예: 환율)에서 제로샷 성능이 비슷하고 미세조정 후 SOTA에 근접한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.