Skip to main content
QUICK REVIEW

[論文レビュー] What Does ChatGPT Make of Historical Stock Returns? Extrapolation and Miscalibration in LLM Stock Return Forecasts

Shuaiyu Chen, T. Clifton Green|arXiv (Cornell University)|Sep 17, 2024
Stock Market Forecasting Methods被引用数 4
ひとこと要約

本稿は、ChatGPTなどの大規模言語モデル(LLM)が歴史的株式リターンを予測する方法を調査し、LLMが最近のパフォーマンスを過剰に外挿していることが判明した。その結果、リターン予測が楽観的になりすぎる。人間のアンケート調査と比較して信頼区間のキャリブレーションが優れているものの、極端な結果の予測に関しては依然としてキャリブレーションがずれており、人間と同様の行動バイアスを示している。

ABSTRACT

We examine how large language models (LLMs) interpret historical stock returns and compare their forecasts with estimates from a crowd-sourced platform for ranking stocks. While stock returns exhibit short-term reversals, LLM forecasts over-extrapolate, placing excessive weight on recent performance similar to humans. LLM forecasts appear optimistic relative to historical and future realized returns. When prompted for 80% confidence interval predictions, LLM responses are better calibrated than survey evidence but are pessimistic about outliers, leading to skewed forecast distributions. The findings suggest LLMs manifest common behavioral biases when forecasting expected returns but are better at gauging risks than humans.

研究の動機と目的

  • LLMが人間ベースの予測手法と比較して、歴史的株式リターンをどのように解釈し、予測するかを検討すること。
  • LLMが金融予測において、最近のパフォーマンスに過剰反応する行動バイアスを示すかどうかを同定すること。
  • LLMの予測精度とキャリブレーションを、実際の歴史的リターンおよび集団予測の株式ランク付けと比較すること。
  • LLMが生成する信頼区間が、株式リターン予測に対して信頼できるものかどうかを評価すること。
  • LLMが金融的期待において、人間の行動バイアスを上回るか、あるいは模倣するかを評価すること。

提案手法

  • 著者は、GPT-3.5およびGPT-4を用いて、標準化された金融データを提示することで、LLMが生成した歴史的株式リターンの予測を収集した。
  • LLMの予測は、実際の歴史的リターンおよび金融予測プラットフォームから得られた集団予測の株式ランク付けと比較された。
  • 予測のキャリブレーションは、80%信頼区間の予測を用いて評価され、カバレッジと分布の歪みが分析された。
  • 統計的分析により、予測バイアス、過信、およびLLMの応答における外挿の程度が測定された。
  • 本研究は、モデルや時間帯にわたる一貫したプロンプトを用いた制御された実験設計を採用し、モデル行動を分離した。
  • 著者は応答の分布を分析し、外れ値予測におけるキャリブレーションのずれを検出するとともに、予測不確実性の対称性を評価した。

実験結果

リサーチクエスチョン

  • RQ1LLMは、人間の行動バイアスと同様に、最近の株式リターンを過剰に外挿するのか?
  • RQ2LLMの予測は、実際の歴史的リターンおよび人間アンケートベースの予測と比較して、正確性とキャリブレーションの点でどのように異なるのか?
  • RQ3LLMが生成する80%信頼区間は適切にキャリブレーションされているのか、それとも極端な結果を系統的に低・過剰に予測するのか?
  • RQ4LLMの予測は、実際の市場パフォーマンスと比較して、楽観的または悲観的である程度はどの程度か?
  • RQ5行動バイアスを示しているにもかかわらず、LLMは人間の予測者よりも下流リスクをより的確に把握できるのか?

主な発見

  • LLMの予測は、顕著な最近の株式リターンの過剰外挿を示しており、人間の短期的逆転バイアスと類似している。
  • LLMの予測は、実際のリターンおよび将来の実現リターンと比較して、系統的に楽観的である。
  • LLMの信頼区間は人間のアンケート予測と比較してキャリブレーションが優れているが、極端な下流外れ値については楽観的でなく、予測分布が歪んでいる。
  • LLMは、テールイベントの予測においてキャリブレーションがずれており、大規模な下落の頻度を低く見積もっている。
  • 行動バイアスが存在するにもかかわらず、LLMは人間の予測者と比較して下流リスクをより的確に把握している。
  • 本研究は、LLMが金融予測において一般的な行動ファイナンスバイアスを再現していることを確認した。特に、リターンの外挿と信頼区間のキャリブレーションのずれの点で顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。