[논문 리뷰] Large Language Models Are Zero-Shot Time Series Forecasters
이 논문은 거대 언어 모델이 숫자를 텍스트로 인코딩하고 예측을 다음 토큰 텍스트 생성으로 다루는 방식으로 제로샷 설정에서 시계열을 예측할 수 있음을 보여주며, 미세조정 없이도 목표에 맞춘 모델에 비해 경쟁력 있거나 우수한 성능을 달성한다.
By encoding time series as a string of numerical digits, we can frame time series forecasting as next-token prediction in text. Developing this approach, we find that large language models (LLMs) such as GPT-3 and LLaMA-2 can surprisingly zero-shot extrapolate time series at a level comparable to or exceeding the performance of purpose-built time series models trained on the downstream tasks. To facilitate this performance, we propose procedures for effectively tokenizing time series data and converting discrete distributions over tokens into highly flexible densities over continuous values. We argue the success of LLMs for time series stems from their ability to naturally represent multimodal distributions, in conjunction with biases for simplicity, and repetition, which align with the salient features in many time series, such as repeated seasonal trends. We also show how LLMs can naturally handle missing data without imputation through non-numerical text, accommodate textual side information, and answer questions to help explain predictions. While we find that increasing model size generally improves performance on time series, we show GPT-4 can perform worse than GPT-3 because of how it tokenizes numbers, and poor uncertainty calibration, which is likely the result of alignment interventions such as RLHF.
연구 동기 및 목표
- LLMs가 미세조정 없이 제로샷으로 시계열 데이터를 예측할 수 있음을 Demonstrate한다.
- 숫자 시퀀스에 대한 효과적인 토큰화 및 연속밀도 매핑을 개발한다.
- LLMs가 시계열의 다중모달 분포와 불확실성을 포착하는지 보여준다.
- 프롬프트를 통한 누락 데이터, 보조 정보, 설명 능력의 취급을 탐구한다.
- 모델 규모와 정렬이 예측 성능 및 불확실성 보정에 어떤 영향을 미치는지 분석한다.
제안 방법
- 시계열을 숫자 자릿수 문자열로 인코딩하여 LLM의 다음 토큰 예측에 활용한다.
- 다양한 모델에서 안정적인 산술 및 패턴 학습을 보장하기 위한 숫자 토큰화 전략을 설계한다(예: 자릿수 단위 토큰화, 공백 및 쉼표 구분자 사용).
- 연속적 토큰 분포를 균일 구간의 계층적 혼합으로 변환하여 확률적 예측 및 가능도 추정이 가능하도록 연속 밀도에 매핑한다.
- 각 자릿수 기반 구간에 균등 분포를 배치하고 원래 공간으로 재스케일링하기 위한 변수변환(change-of-variables)을 적용하여 연속 가능도를 근사한다.
- LLM에서 여러 미래를 샘플링하고 이를 집계하여 점 예측 및 확률 예측(분위수, CRPS, NLL)을 형성한다.
- 다양한 데이터셋에서 제로샷 LLM 예측을 표준 시계열 기준과 비교하고 모델 간 보정(calibration)을 분석한다.
실험 결과
연구 질문
- RQ1숫자가 텍스트로 인코딩되었을 때 사전 학습된 LLM이 미세조정 없이 시계열 예측을 수행할 수 있는가?
- RQ2LLMs의 예측 정확도와 안정적인 수치 추론을 극대화하기 위해 시계열 데이터를 어떻게 토큰화해야 하는가?
- RQ3LLMs가 시계열의 잘 보정된 확률 예측과 불확실성 추정치를 제공할 수 있는가?
- RQ4모델 규모와 정렬(RLHF 등)이 예측 성능 및 불확실성 보정에 어떤 영향을 미치는가?
- RQ5누락 데이터, 텍스트 보조 정보, 설명 프롬프트가 LLM의 예측에 어떤 영향을 미치는가?
주요 결과
- LLMTime은 다양한 데이터셋에서 제로샷 예측에서 목적 빌트 시계열 방법을 능가하거나 일치할 수 있다.
- 적절한 숫자 토큰화와 재스케일링은 LLM의 성능과 수치적 추론에 결정적이다.
- 자릿수 기반의 연속 밀도를 통해 다중모달 및 불확실한 연속성을 표현할 수 있어 확률 예측을 개선한다.
- GPT-3 및 LLaMA-2 70B는 강한 결정론적 성능을 보이며, NLL 및 CRPS와 같은 확률 지표가 종종 베이스라인을 능가한다.
- GPT-4 및 채팅식 LLM은 정렬 개입(RLHF) 및 토큰화 특이성으로 보정이나 예측 성능이 더 낮아질 수 있다.
- 불확실성 표현은 기본 모델의 질이 높을수록 개선되며, 제로샷 성능은 모델 크기에 따라 증가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.