Skip to main content
QUICK REVIEW

[논문 리뷰] VisionTS: Visual Masked Autoencoders Are Free-Lunch Zero-Shot Time Series Forecasters

Mouxiang Chen, Lefei Shen|arXiv (Cornell University)|2024. 08. 30.
Forecasting Techniques and ApplicationsDecision Sciences인용 수 3
한 줄 요약

VisionTS는 ImageNet에서 사전 훈련된 시각 기반 마스킹 오토인코더를 활용하여 어떤 미세조정 없이도 시간 시리즈 예측을 수행하는 혁신적인 제로샷 예측 프레임워크를 제안한다. 1차원 시간 시리즈를 2차원 이미지 유사 행렬로 변환하고, 시각 모델의 자기지도 학습 표현을 활용함으로써 VisionTS는 제로샷 성능에서 최고 수준을 달성하며, Moirai Large와 같은 기존 기초 모델을 뛰어넘는 성능을 보이며, 시각 모델이 시간 시리즈 예측에 있어 '무료 점심'이 될 수 있음을 보여준다.

ABSTRACT

Foundation models have emerged as a promising approach in time series forecasting (TSF). Existing approaches either repurpose large language models (LLMs) or build large-scale time series datasets to develop TSF foundation models for universal forecasting. However, these methods face challenges due to the severe cross-domain gap or in-domain heterogeneity. This paper explores a new road to building a TSF foundation model from rich, high-quality natural images. Our key insight is that a visual masked autoencoder, pre-trained on the ImageNet dataset, can naturally be a numeric series forecaster. By reformulating TSF as an image reconstruction task, we bridge the gap between image pre-training and TSF downstream tasks. Surprisingly, without further adaptation in the time series domain, the proposed VisionTS could achieve better zero-shot forecast performance than existing TSF foundation models. With fine-tuning for one epoch, VisionTS could further improve the forecasting and achieve state-of-the-art performance in most cases. Extensive experiments reveal intrinsic similarities between images and real-world time series, suggesting that visual models may offer a "free lunch" for TSF and highlight the potential for future cross-modality research. Our code is publicly available at https://github.com/Keytoyze/VisionTS.

연구 동기 및 목표

  • 사전 훈련된 시각 모델이 제로샷 시간 시리즈 예측을 위한 기초 모델로 기능할 수 있는지 탐구하기.
  • 기존 텍스트 기반 및 시간 시리즈 기반 기초 모델이 겪는 도메인 간 격리 또는 데이터 이질성 문제를 해결하기.
  • 이미지와 시간 시리즈 간의 공통된 구조적 및 물리적 특성을 활용하여 모odal 갭을 해소하기.
  • ImageNet에서 사전 훈련된 시각 마스킹 오토인코더가 추가 적응 없이도 시간 시리즈 예측에 일반화 가능한지 평가하기.
  • 시각 모델이 도메인 특화 기초 모델에 비해 저비용으로 고성능을 제공할 수 있음을 입증하기.

제안 방법

  • 시간 패턴을 유지하기 위해 1차원 시간 시리즈 데이터를 세그먼테이션을 통해 2차원 행렬로 변환하기.
  • 시각 마스킹 오토인코더(MAE)를 사용하여 시간 시리즈 예측을 패치 수준의 이미지 재구성 작업으로 재정의하기.
  • 일반적인 시간 시리즈 특징인 추세, 계절성, 정상성 등을 학습한 이미지넷에서 사전 훈련된 시각 MAE를 활용하여 얻은 표현 사용하기.
  • 추론 중 향후 예측 윈도우에 마스킹을 적용하여, 이를 예측해야 할 손실 패치로 간주하고 재구성하기.
  • 시간 시리즈 데이터에 대한 어떤 미세조정 없이도 사전 훈련된 시각 모델을 직접 사용하여 제로샷 예측 수행하기.
  • 최소한의 적응을 위해 레이어 정규화 구성 요소만 미세조정하여 대부분의 벤치마크에서 최고 성능 달성하기.

실험 결과

연구 질문

  • RQ1ImageNet에서 사전 훈련된 시각 기반 마스킹 오토인코더가 시간 시리즈 예측에서 경쟁적인 제로샷 성능을 달성할 수 있는가?
  • RQ2VisionTS의 성능은 제로샷 설정에서 기존 텍스트 기반 및 시간 시리즈 기반 기초 모델과 비교해 어떻게 되는가?
  • RQ3다양한 미세조정 전략이 VisionTS의 예측 정확도에 어떤 영향을 미치는가?
  • RQ4이미지와 시간 시리즈 간의 내재적 유사성이 시각에서 시간 시리즈 예측으로의 효과적인 전이 학습을 가능하게 하는가?
  • RQ5VisionTS는 Moirai Large와 같은 강력한 베이스라인에 비해 어떤 예측 시나리오에서 슈퍼리어하고, 어떤 경우에는 열등한가?

주요 결과

  • VisionTS는 여러 벤치마크에서 제로샷 예측 성능에서 최고 성능을 기록하며, 어떤 미세조정 없이도 기존에 가장 큰 기초 모델인 Moirai Large를 뛰어넘는다.
  • ETTh1 데이터셋에서 VisionTS는 제로샷 설정에서 MAE 0.395를 기록했으며, Moirai Large의 0.534와 비교해 25.8%의 상대적 향상도를 보였다.
  • 단 한 에포크의 미세조정만으로도 대부분의 장기 예측 벤치마크에서 SOTA 성능을 달성했으며, 제로샷 성능 대비 평균 MAE 향상률이 최대 15%에 이르렀다.
  • 아블레이션 연구 결과 시각 지식이 핵심임을 확인했다: 시각 모델을 제거한 경우(w/o VM) ETTh1에서 MAE는 0.534로 떨어지지만, 전체 VisionTS 모델은 0.395를 기록한다.
  • 레이어 정규화(LN)만 미세조정하는 것이 가장 우수한 성능을 보였으며, 평균 MAE 0.333을 기록하여 전체 미세조정 및 기타 파rameter별 전략을 모두 뛰어넘었다.
  • 시각화 결과 VisionTS는 규칙적인 패턴(예: 그림 8)에 대해 잘 일반화되지만, 패턴이 적은 입력에서는 추세에 과적합되는 경향이 있으며, 이 경우 Moirai Large가 더 우수한 성능을 보였다(그림 11).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.