Skip to main content
QUICK REVIEW

[论文解读] Solving Heterogeneous General Equilibrium Economic Models with Deep Reinforcement Learning

Edward W. Hill, Marco Bardoscia|arXiv (Cornell University)|Mar 31, 2021
COVID-19 epidemiological studies被引用 6
一句话总结

本文提出一种深度强化学习(DRL)框架,用于求解宏观经济学中的异质性代理人一般均衡模型,克服了传统半解析方法的局限性。通过训练代理人以在市场出清约束下优化跨期效用,该方法在具有随机性、异质性和动态反馈的复杂模型中实现了精确、稳定且可扩展的求解——在预防性储蓄模型、随机RBC模型以及包含年龄相关风险与劳动供给响应的疫情-宏观大流行模型中得到验证。

ABSTRACT

General equilibrium macroeconomic models are a core tool used by policymakers to understand a nation's economy. They represent the economy as a collection of forward-looking actors whose behaviours combine, possibly with stochastic effects, to determine global variables (such as prices) in a dynamic equilibrium. However, standard semi-analytical techniques for solving these models make it difficult to include the important effects of heterogeneous economic actors. The COVID-19 pandemic has further highlighted the importance of heterogeneity, for example in age and sector of employment, in macroeconomic outcomes and the need for models that can more easily incorporate it. We use techniques from reinforcement learning to solve such models incorporating heterogeneous agents in a way that is simple, extensible, and computationally efficient. We demonstrate the method's accuracy and stability on a toy problem for which there is a known analytical solution, its versatility by solving a general equilibrium problem that includes global stochasticity, and its flexibility by solving a combined macroeconomic and epidemiological model to explore the economic and health implications of a pandemic. The latter successfully captures plausible economic behaviours induced by differential health risks by age.

研究动机与目标

  • 解决传统半解析方法在求解具有异质性代理人的宏观一般均衡模型时的局限性,尤其是在存在随机性和动态反馈的情况下。
  • 实现对现实经济现象(如疫情冲击、年龄差异化劳动供给、部门异质性)的建模,这些现象是标准代表性代理人模型无法捕捉的。
  • 开发一种计算高效、可扩展且稳定的框架,用于求解具有连续决策变量和全局约束的理性预期均衡(REE)模型。
  • 在多种宏观经济学场景中展示该方法的准确性与鲁棒性,包括存在全局随机冲击和内生健康-经济互动的模型。
  • 通过实现不确定性下可扩展的前瞻性代理人行为,弥合宏观经济学与强化学习之间的鸿沟,具备政策相关模拟和逆向强化学习应用的潜力。

提出的方法

  • 将一般均衡模型表述为马尔可夫决策过程,其中家庭和企业需在预算约束和生产约束下优化跨期效用。
  • 使用具有优先经验回放和目标网络的深度Q网络(DQN),以稳定高维连续状态与动作空间中代理人的训练过程。
  • 采用集中式训练、分布式执行(CTDE)方法,其中全局市场出清条件(如价格、利率)由代理人群体的总行动计算得出。
  • 通过对数自回归过程整合全局随机变量(如技术冲击),使代理人能够选择性地观测或不观测冲击实现,从而影响其策略学习。
  • 采用离策略经验回放,通过在多个模拟中并行收集经验轨迹,提升样本效率。
  • 应用价值函数平均化与学习率衰减,以稳定收敛过程并减少策略学习中的振荡。

实验结果

研究问题

  • RQ1深度强化学习能否准确求解具有异质性代理人和连续决策变量的理性预期均衡模型?
  • RQ2代理人能否观测到全球随机冲击(如技术冲击)如何影响其劳动供给路径的稳定性与曲率?
  • RQ3DRL框架能否有效建模复杂现实互动,如疫情动态与宏观经济结果之间的反馈回路?
  • RQ4在建模具有不同偏好与约束的异质性代理人时,该方法在计算效率与收敛稳定性方面表现如何?
  • RQ5该框架在健康风险下在多大程度上能捕捉现实经济行为,如预防性储蓄和按年龄组划分的差异化劳动供给?

主要发现

  • DRL方法成功求解了具有已知解析解的基准预防性储蓄模型,在多次运行中均表现出高精度与高稳定性。
  • 能够观测技术冲击实现的代理人,其劳动供给路径显著更平滑,平均无符号曲率从非观测者(0.44)下降至观测者(0.27)。
  • 在疫情-宏观模型中,该框架准确捕捉了对不同健康风险的年龄差异化劳动供给响应,展示了疫情动态带来的合理宏观经济反馈。
  • 通过并行经验收集,该方法在计算效率与收敛稳定性方面表现良好,使用8个线程和约10万个总经验,在约6小时内实现收敛。
  • 优先经验回放与学习率衰减的使用显著提升了训练稳定性,并减少了策略学习中的振荡。
  • 该框架能有效处理生产冲击中的全局随机性,即使并非所有代理人都具备完全可观测性,代理人仍能动态适应自回归技术过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。