Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning in a Monetary Model

Mingli Chen, Andreas Joseph|arXiv (Cornell University)|Apr 19, 2021
Monetary Policy and Economic Impact参考文献 23被引用 10
一句话总结

本文提出使用深度强化学习(DRL)求解具有有限理性的代理的动态随机一般均衡(DSGE)模型,其中家庭通过与经济体系的交互学习最优消费和储蓄决策,而无需事先了解其结构。与自适应学习不同,DRL代理在所有货币和财政政策制度下均成功收敛至所有稳态解,展现出稳健性与全局学习能力。

ABSTRACT

We propose using deep reinforcement learning to solve dynamic stochastic general equilibrium models. Agents are represented by deep artificial neural networks and learn to solve their dynamic optimisation problem by interacting with the model environment, of which they have no a priori knowledge. Deep reinforcement learning offers a flexible yet principled way to model bounded rationality within this general class of models. We apply our proposed approach to a classical model from the adaptive learning literature in macroeconomics which looks at the interaction of monetary and fiscal policy. We find that, contrary to adaptive learning, the artificially intelligent household can solve the model in all policy regimes.

研究动机与目标

  • 通过引入一种更灵活、非参数化的有限理性方法,解决理性预期和自适应学习在宏观经济学模型中的局限性。
  • 研究深度强化学习(DRL)是否能够求解具有代表性家庭的复杂DSGE模型,且在不同货币和财政政策制度下表现良好。
  • 评估DRL代理是否能够收敛至所有稳态解,包括在自适应学习下无法学习的解。
  • 通过使用非参数化、函数逼近的神经网络,提供一种计算上可行且有原则的参数化学习模型替代方案。
  • 建立一个在连续谱上衡量和校准有限理性的框架,利用学习曲线和价值函数实现量化。

提出的方法

  • 将代理表示为深度人工神经网络,通过与模拟经济环境的交互学习最优决策规则。
  • 使用能够处理高维连续动作空间的基于策略的深度强化学习算法(例如SAC)。
  • 将奖励函数定义为家庭的贴现效用,状态变量包括通货膨胀率、货币持有量和产出。
  • 采用基于效用收敛(d_u^min)的终止条件进行回合制训练,当效用变化低于阈值时结束回合。
  • 使用经验回放和目标网络稳定学习过程,通过随机策略实现探索。
  • 通过深度神经网络进行函数逼近,实现无需假设策略或价值函数具体参数形式的非参数学习。

实验结果

研究问题

  • RQ1深度强化学习代理是否能够在不同货币和财政政策制度下求解具有多个稳态的典型货币DSGE模型?
  • RQ2在收敛至稳态和政策制度下的稳定性方面,DRL代理与自适应学习代理的表现如何比较?
  • RQ3DRL代理在不事先了解模型结构方程或运动规律的情况下,能够在多大程度上学习最优决策规则?
  • RQ4DRL的全局学习能力是否使代理能够达到所有可能的稳态,包括在自适应学习下无法达到的稳态?
  • RQ5超参数(如效用收敛阈值d_u^min)如何影响学习精度和收敛速度?

主要发现

  • DRL代理在所有测试的货币和财政政策制度下均成功收敛至所有稳态解,包括在自适应学习下无法学习的解。
  • 在PMP-AFP制度下,将效用收敛阈值(d_u^min)从1e-7降低至1e-9显著提升了学习精度和动作收敛性,如图10所示。
  • DRL方法在无需对策略或预测规则的函数形式做参数假设的情况下实现了稳定学习。
  • 该方法对模型复杂性和政策制度变化具有鲁棒性,代理通过交互而非结构知识学习最优行为。
  • DRL学习的全局特性使代理能够收敛至多个均衡,而自适应学习在某些政策组合下可能无法收敛。
  • 该方法提供了一个连续的有限理性谱系,学习行为可通过价值函数学习曲线和收敛度量进行量化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。