[论文解读] Surveying Generative AI's Economic Expectations
本文提出使用大型语言模型(LLMs),如 GPT-3.5,通过提示其处理历史《华尔街日报》文章来生成经济预期,表明基于 LLM 的预期与既有的调查数据(如《专业预测者调查》(SPF)、AAII 和杜克 CFO 调查)高度一致。主要发现是,LLM 复现了诸如反应不足和外推式预期等行为偏差,表明其超越记忆能力而具备泛化能力,可作为建模非理性预期的新型、可扩展代理指标。
I introduce a survey of economic expectations formed by querying a large language model (LLM)'s expectations of various financial and macroeconomic variables based on a sample of news articles from the Wall Street Journal between 1984 and 2021. I find the resulting expectations closely match existing surveys including the Survey of Professional Forecasters (SPF), the American Association of Individual Investors, and the Duke CFO Survey. Importantly, I document that LLM based expectations match many of the deviations from full-information rational expectations exhibited in these existing survey series. The LLM's macroeconomic expectations exhibit under-reaction commonly found in consensus SPF forecasts. Additionally, its return expectations are extrapolative, disconnected from objective measures of expected returns, and negatively correlated with future realized returns. Finally, using a sample of articles outside of the LLM's training period I find that the correlation with existing survey measures persists -- indicating these results do not reflect memorization but generalization on the part of the LLM. My results provide evidence for the potential of LLMs to help us better understand human beliefs and navigate possible models of nonrational expectations.
研究动机与目标
- 开发一种新颖且可扩展的方法,利用大型语言模型(LLMs)生成经济预期代理指标。
- 验证基于 LLM 的预期是否复现传统调查中观察到的、与理性预期偏离的行为偏差。
- 通过评估模型在训练期之外数据上的表现,检验 LLM 是否超越记忆能力而实现泛化。
- 探究 LLM 预期是否受未来实际结果或 SPF 修订信息的影响,排除数据泄露的可能性。
提出的方法
- 微调 GPT-3.5,通过提示其处理 1984 至 2021 年的《华尔街日报》历史文章,以预测金融与宏观经济变量。
- 将单篇文章层面的预期聚合为基于月度和季度的时间序列 LLM 预测数据。
- 使用相关性与回归分析,将 LLM 预期与基准调查(包括 SPF、AAII 和杜克 CFO 调查)进行比较。
- 利用 2021 年 9 月至 2023 年 3 月的《华尔街日报》文章进行样本外测试,评估模型在训练数据之外的泛化能力。
- 通过面板回归分析,检验 LLM 预期是否与 SPF 修订或实际结果相关,以识别其预测能力的来源。
- 使用 Newey-West 和 Driscoll-Kraay 标准误,以控制时间序列与面板数据中的序列相关性与横截面相关性。
实验结果
研究问题
- RQ1LLM 能否生成与《专业预测者调查》(SPF)、AAII 和杜克 CFO 调查等既有的基于调查的衡量指标高度一致的经济预期?
- RQ2LLM 生成的预期是否表现出与人类调查数据中观察到的相同行为偏差(如反应不足和外推式预期)?
- RQ3LLM 预期与调查指标之间的相关性是源于对训练数据的记忆,还是反映了对样本外数据的泛化能力?
- RQ4LLM 预期是否受对未来实际结果的了解驱动,或是否受现有调查预测修订的影响?
- RQ5LLM 是否复现了行为金融学中观察到的预期回报与客观预期回报之间的脱节现象?
主要发现
- LLM 生成的预期与《专业预测者调查》(SPF)、AAII 和杜克 CFO 调查之间表现出显著相关性,相关性水平与替代性调查衡量指标相当。
- LLM 在宏观经济预测中表现出反应不足,与共识 SPF 预测中已知的行为偏差一致。
- LLM 的回报预期具有外推性,与客观预期回报衡量指标脱钩,且与未来实际回报负相关——与行为金融学文献一致。
- LLM 预期与调查指标之间的相关性在样本外数据(2021 年 9 月之后)中依然存在,表明其反映的是泛化能力而非记忆效应。
- LLM 预期并非受未来实际结果影响,而是与 SPF 修订相关,表明其与基于调查的信念形成机制一致。
- LLM 复现了理性预期关键偏离特征,如 CG(Coibion-Gorodnichenko)系数模式,证实其具备模拟人类信念形成偏差的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。