Skip to main content
QUICK REVIEW

[논문 리뷰] Mixture-of-Linear-Experts for Long-term Time Series Forecasting

Ronghao Ni, Zinan Lin|arXiv (Cornell University)|2023. 12. 11.
Hydrological Forecasting Using AI인용 수 7
한 줄 요약

MoLE은 시간 시작 임베딩에 기반한 혼합 전문가 라우터로 다수의 선형 예측기를 적응적으로 가중시켜 선형 중심의 LTSF 모델을 보강하고 다양한 데이터셋에서 예측 정확도를 향상시킵니다.

ABSTRACT

Long-term time series forecasting (LTSF) aims to predict future values of a time series given the past values. The current state-of-the-art (SOTA) on this problem is attained in some cases by linear-centric models, which primarily feature a linear mapping layer. However, due to their inherent simplicity, they are not able to adapt their prediction rules to periodic changes in time series patterns. To address this challenge, we propose a Mixture-of-Experts-style augmentation for linear-centric models and propose Mixture-of-Linear-Experts (MoLE). Instead of training a single model, MoLE trains multiple linear-centric models (i.e., experts) and a router model that weighs and mixes their outputs. While the entire framework is trained end-to-end, each expert learns to specialize in a specific temporal pattern, and the router model learns to compose the experts adaptively. Experiments show that MoLE reduces forecasting error of linear-centric models, including DLinear, RLinear, and RMLP, in over 78% of the datasets and settings we evaluated. By using MoLE existing linear-centric models can achieve SOTA LTSF results in 68% of the experiments that PatchTST reports and we compare to, whereas existing single-head linear-centric models achieve SOTA results in only 25% of cases.

연구 동기 및 목표

  • 장기 시계열 예측에서 비정상적 시간 패턴을 더 잘 다루어야 할 필요성을 제시한다.
  • 선형 중심의 LTSF 모델에 대한 플러그인 형태의 Mixture-of-Experts 증강인 MoLE를 소개한다.
  • MoLE가 여러 데이터셋 및 기본 선형 모델 전반에서 예측 정확도를 향상시킨다는 것을 입증한다.
  • 시간 의식적 전문화에서 비롯된 이득임을 보여주기 위한 애블레이션을 제공한다. 모델 규모 증가와는 무관하다.

제안 방법

  • MoLE를 사용해 어떠한 선형 중심의 LTSF 모델이든 확장한다. 이는 다수의 전문가 헤드와 채널 의 라우터를 생성한다.
  • 라우터는 첫 타임스탬프의 임베딩으로 채널당 가중치를 생성하기 위해 이층 MLP를 사용한다.
  • 전문가의 출력을 채널별 가중 합으로 결합하고 이후 후처리 층을 통해 최종 예측을 산출한다.
  • 시간 특성을 datetime 유사 임베딩에 임베딩하고 간단한 정규화를 적용한다.
  • 백본으로 DLinear, RLinear, RMLP를 실험하고 단일 헤드 vs 다중 헤드 MoLE 변형을 비교한다.
  • TimeIn, RandomIn, RandomOut를 포함한 애블레이션을 수행해 타임스탬프 조건화와 무작위성의 역할을 평가한다.

실험 결과

연구 질문

  • RQ1Mixture-of-Linear-Experts가 선형 중심의 LTSF 모델에 적용될 때 장기 예측 정확도를 향상시킬 수 있는가?
  • RQ2믹서를 첫 번째 타임스탬프 임베딩으로 조건화하는 것이 모델 용량 증가를 넘어선 이점을 제공하는가?
  • RQ3MoLE의 성능은 데이터셋, 예측 시계 길이, 입력 시퀀스 길이에 따라 어떻게 달라지는가?
  • RQ4이득이 주로 시간 의식적 전문화로 인한 것인지, 단순한 파라미터 증가 때문인지?
  • RQ5헤드 수, 드롭아웃, 배치 크기 등 하이퍼파라미터가 MoLE 성능에 어떤 영향을 미치는가?

주요 결과

  • MoLE는 DLinear의 예측 오차를 32/44 설정에서 개선합니다(73%).
  • MoLE는 RLinear의 예측 오차를 38/44 설정에서 개선합니다(86%).
  • MoLE는 RMLP의 예측 오차를 33/44 설정에서 개선합니다(75%).
  • Weather2K 전반에 걸쳐 MoLE-선형 모델은 평가된 모든 설정에서 최첨단 성능을 달성한다.
  • 전반적으로 MoLE는 PatchTST에 보고된 설정의 68%에서 선형 중심 모델이 SOTA에 도달하도록 하며(단일 헤드 기준은 25%).
  • 애블레이션에서 이득은 시간 의식적 전문화된 전문가들로부터 기인하며, 입력 길이가 예측 길이에 비해 짧을수록 더 큰 이득이 나타난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.