Skip to main content
QUICK REVIEW

[논문 리뷰] MQTransformer: Multi-Horizon Forecasts with Context Dependent and Feedback-Aware Attention

Carson Eisenach, Yagna Patel|arXiv (Cornell University)|2020. 09. 30.
Traffic Prediction and Management Techniques인용 수 10
한 줄 요약

MQTransformer는 다중 수평 예측을 위한 새로운 Transformer 기반 아키텍처를 도입하여, 맥락에 따라 달라지는 위치 인코딩, 수평별로 특화된 디코더-에코더 어텐션, 피드백 인식 자가어텐션을 통해 정확도를 향상시키고 예측 변동성을 감소시킨다. 정점 기간 동안 33% 낮은 퀀틸 기반 손실과 P50 기준 67% 감소한 과도한 변동성을 기록하며, TFT 및 MQ-CNN와 같은 최신 기술 모델들을 공개 벤치마크에서 능가한다.

ABSTRACT

Recent advances in neural forecasting have produced major improvements in accuracy for probabilistic demand prediction. In this work, we propose novel improvements to the current state of the art by incorporating changes inspired by recent advances in Transformer architectures for Natural Language Processing. We develop a novel decoder-encoder attention for context-alignment, improving forecasting accuracy by allowing the network to study its own history based on the context for which it is producing a forecast. We also present a novel positional encoding that allows the neural network to learn context-dependent seasonality functions as well as arbitrary holiday distances. Finally we show that the current state of the art MQ-Forecaster (Wen et al., 2017) models display excess variability by failing to leverage previous errors in the forecast to improve accuracy. We propose a novel decoder-self attention scheme for forecasting that produces significant improvements in the excess variation of the forecast.

연구 동기 및 목표

  • 최신 다중 수평 예측 모델들이 과거 예측 오차를 학습하지 못함으로써 발생하는 과도한 예측 변동성을 해결하기 위해.
  • 맥락에 따라 달라지는 계절성과 수평별로 특화된 표현을 어텐션 메커니즘에 통합하여 예측 정확도를 향상시키기 위해.
  • 확률적 시계열 예측을 위한 적절한 인덕티브 바이어스를 학습할 수 있는 신경망 아키텍처를 설계하여 계산 효율성을 희생하지 않도록 하기 위해.
  • 예측 맥락과 이력 오차 패tern에 따라 주의를 동적으로 조정할 수 있도록 모델을 설계하여 예측의 진화를 향상시키기 위해.
  • 예측 변동성 감소와 정확도 향상은 상호 보완적일 수 있으며, 아키텍처 혁신을 통해 동시에 달성할 수 있음을 입증하기 위해.

제안 방법

  • 특정 도메인의 이벤트 지표(예: 공휴일, 프ом모션)에서 유도된 새로운 위치 인코딩을 도입하여 맥락에 따라 달라지는 계절성 함수를 학습한다.
  • 디코더가 각 예측 수평에 맞게 조정된 인코더 상태에 주의를 기울일 수 있도록 수평별로 특화된 디코더-에코더 어텐션을 제안한다. 이는 표현의 정밀도를 향상시킨다.
  • 과거 예측 오차에 대한 지식을 통합할 수 있도록 피드백 인식 디코더-자기어텐션 메커니즘을 설계하여 과도한 변동성을 감소시킨다.
  • 모든 이용 가능한 트랙토리(예: 소매 데이터셋에서 2000만 건)를 활용할 수 있도록 포크링 시퀀스를 사용한다. 이는 데이터를 다운샘플링하지 않고도 전체 데이터 활용을 가능하게 한다.
  • 과도한 변동성에 대한 명시적 정규화 없이도 안정성을 향상시키기 위해 단일 목적 함수(퀀틸 손실)를 사용한다. 이는 아키텍처 설계를 통해 달성된다.
  • NLP 응용과는 다릅니다. 시계열 예측에 특화된 수정된 인덕티브 바이어스를 가진 Transformer 기반 어텐션 메커니즘을 활용한다.

실험 결과

연구 질문

  • RQ1자신의 이력 오차를 학습함으로써 Transformer 기반 아키텍처가 예측 변동성을 줄일 수 있는가?
  • RQ2맥락에 따라 달라지는 위치 인코딩이 고정된 공휴일 거리 외의 복잡한 계절성 패턴을 더 잘 모델링할 수 있는가?
  • RQ3수평별로 특화된 어텐션은 프ом모션 또는 계절적 정점과 같은 하위 문제의 예측 정확도를 향상시키는가?
  • RQ4어텐션 메커니즘의 아키텍처 혁신이 정확도 향상과 과도한 변동성 감소를 동시에 달성할 수 있는가? 이는 상호 보완적일 수 있는가?
  • RQ5피드백 인식 자가어텐션과 같은 아키텍처 선택이 다중 수평 예측에서 표준 어텐션 메커니즘을 뛰어넘는가?

주요 결과

  • 기준 모델인 MQ-Forecaster 대비 P50 퀀틸 기준으로 과도한 예측 변동성을 67% 감소시켰고, P90 기준으로는 95% 감소시켰다.
  • 가장 도전적인 소매 예측 과제에서 MQTransformer는 P50 기준으로 이전 최고 성능 모델(TFT) 대비 38% 향상되었고, P90 기준으로는 11% 향상되었다.
  • 연간 전체 기간 동안 P90 퀀틸 손실이 5.5% 감소했고, 정점 기간에는 최대 33% 향상되었다.
  • 단일 V100 GPU를 사용하여 2000만 개의 트랙토리에서 1에포크당 5분 내로 학습이 가능했으며, TFT(13분/에포크)를 능가했고, 전체 데이터 활용이 가능했다.
  • 포크링 시퀀스 없이 45만 개의 서브샘플로 재학습한 경우에도 MQTransformer는 전체 데이터로 학습된 MQ-CNN 기반 모델과 비교해 유사한 성능유지했다.
  • 전기 부하, 변동성, 교통 예측 과제를 포함한 네 개의 공개 데이터셋에서 DeepAR, ConvTrans, MQ-RNN, TFT와 같은 최신 모델들과 비교해 정상적 또는 슈퍼리어한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.