[논문 리뷰] What Does ChatGPT Make of Historical Stock Returns? Extrapolation and Miscalibration in LLM Stock Return Forecasts
이 논문은 챗지피티와 같은 대규모 언어모델(LLM)이 역사적 주가 수익률을 어떻게 예측하는지 조사하며, LLM이 최근 성과를 과도하게 외삽하여 과도하게 낙관적인 수익률 예측을 내놓는다는 점을 드러낸다. 인간 설문 조사보다 신뢰구간 캘리브레이션 능력은 뛰어나지만, 극단적 결과를 예측하는 데서는 여전히 잘못 캘리브레이션되어 있어 인간과 유사한 행동적 편향을 보인다.
We examine how large language models (LLMs) interpret historical stock returns and compare their forecasts with estimates from a crowd-sourced platform for ranking stocks. While stock returns exhibit short-term reversals, LLM forecasts over-extrapolate, placing excessive weight on recent performance similar to humans. LLM forecasts appear optimistic relative to historical and future realized returns. When prompted for 80% confidence interval predictions, LLM responses are better calibrated than survey evidence but are pessimistic about outliers, leading to skewed forecast distributions. The findings suggest LLMs manifest common behavioral biases when forecasting expected returns but are better at gauging risks than humans.
연구 동기 및 목표
- LLM이 인간 기반 예측 방법과 비교해 역사적 주가 수익률을 어떻게 해석하고 예측하는지 조사하기 위해.
- LLM이 재무 예측에서 최근 성과에 과민하게 반응하는 행동적 편향을 보이는지 확인하기 위해.
- 역사적 실현 수익률과 인적 집단 예측 순위와 비교해 LLM의 예측 정확도와 캘리브레이션을 비교하기 위해.
- LLM이 생성한 신뢰구간이 주가 수익률 예측에 대해 신뢰할 수 있는지 평가하기 위해.
- LLM이 재무 기대치에서 인간의 행동적 편향을 초월하거나 그대로 반복하는지 평가하기 위해.
제안 방법
- 저자는 표준화된 금융 데이터를 활용해 GPT-3.5와 GPT-4를 통해 LLM이 생성한 역사적 주가 수익률 예측을 수집한다.
- LLM 예측은 실현된 역사적 수익률과 재무 예측 플랫폼에서 확보한 인적 집단 예측 순위와 비교된다.
- 80% 신뢰구간 예측을 사용해 캘리브레이션을 평가하며, 커버리지와 분포의 비대칭성(왜곡)을 분석한다.
- 통계 분석을 통해 예측 편향, 과신, LLM 응답에서의 외삽 정도를 측정한다.
- 모델과 시간대에 걸쳐 일관된 프롬프트를 사용한 제어된 실험 설계를 통해 모델 행동을 고립한다.
- 응답 분포를 분석해 이상치 예측에서의 캘리브레이션 오류를 탐지하고, 예측 불확실성의 대칭성을 평가한다.
실험 결과
연구 질문
- RQ1LLM은 인간의 행동적 편향과 유사하게 최근 주가 수익률을 과도하게 외삽하는가?
- RQ2정확도와 캘리브레이션 측면에서 LLM 예측은 실현된 역사적 수익률과 인간 설문 기반 예측과 비교해 어떻게 다른가?
- RQ3LLM이 생성한 80% 신뢰구간은 잘 캘리브레이션되어 있는가, 아니면 극단적 결과를 체계적으로 과소 또는 과대 예측하는가?
- RQ4실제 시장 성과와 비교해 LLM 예측은 얼마나 낙관적 또는 비관적인가?
- RQ5행동적 편향을 보이지만, 인간 예측자보다 LLM이 하방 리스크를 더 잘 평가할 수 있는가?
주요 결과
- LLM 예측은 최근 주가 수익률에 대해 심각한 과도한 외삽을 보이며, 인간의 단기 반전 편향과 유사하다.
- LLM 예측은 역사적 수익률과 향후 실현 수익률보다 체계적으로 낙관적이다.
- LLM의 신뢰구간은 인간 설문 예측보다 더 잘 캘리브레이션되어 있지만, 극단적 하방 이상치에 대해 비관적으로 반응하여 예측 분포가 비대칭이 된다.
- LLM은 꼬리 사건(극단적 음성 수익률)을 예측할 때 캘리브레이션에 어긋나며, 큰 음성 수익률의 빈도를 과소 평가한다.
- 행동적 편향이 있음에도 불구하고, LLM은 인간 예측자보다 하방 리스크를 더 잘 평가하는 데 뛰어난 능력을 보인다.
- 이 연구는 LLM이 재무 예측에서 일반적인 행동 금융 편향을 재현함을 확인하였으며, 특히 수익률 외삽과 신뢰구간 캘리브레이션 오류에서 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.