Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning in a Monetary Model

Mingli Chen, Andreas Joseph|arXiv (Cornell University)|Apr 19, 2021
Monetary Policy and Economic Impact参考文献 23被引用数 10
ひとこと要約

本稿では、深層強化学習(DRL)を用いて、境界つき合理主義的エージェントを有する動的確率的一般均衡(DSGE)モデルを解く手法を提案する。家計は経済との相互作用を通じて、事前の構造的知識なしに最適な消費および貯蓄意思決定を学習する。アダプティブ学習とは異なり、DRLエージェントは、金融政策および財政政策のあらゆる制度下において、すべての定常状態解に収束し、強靭性とグローバル学習能力を示す。

ABSTRACT

We propose using deep reinforcement learning to solve dynamic stochastic general equilibrium models. Agents are represented by deep artificial neural networks and learn to solve their dynamic optimisation problem by interacting with the model environment, of which they have no a priori knowledge. Deep reinforcement learning offers a flexible yet principled way to model bounded rationality within this general class of models. We apply our proposed approach to a classical model from the adaptive learning literature in macroeconomics which looks at the interaction of monetary and fiscal policy. We find that, contrary to adaptive learning, the artificially intelligent household can solve the model in all policy regimes.

研究の動機と目的

  • 合理的期待とアダプティブ学習の限界を克服し、境界つき合理主義に対してより柔軟で非パラメトリックなアプローチを提供すること。
  • 深層強化学習(DRL)が、さまざまな金融および財政政策制度下における代表的家計を有する複雑なDSGEモデルを解くことができるかを調査すること。
  • DRLエージェントが、アダプティブ学習下で学習不能な定常状態解にも収束できるかを評価すること。
  • パラメトリックな学習モデルの代替として、非パラメトリックで関数近似を用いるニューラルネットワークを用いることで、計算的に実行可能で原理的整合性のある代替案を提供すること。
  • 学習曲線と価値関数を用いて、連続的スケール上での境界つき合理主義の測定とキャリブレーションを可能とするフレームワークを構築すること。

提案手法

  • エージェントを深層人工ニューラルネットワークとして定式化し、模擬経済環境との相互作用を通じて最適意思決定ルールを学習する。
  • 高次元連続的行動空間を扱えるポリシーに基づく深層強化学習アルゴリズム(例:SAC)を用いる。
  • 報酬関数を、インフレ率、マネー保有高、出力などの状態変数を含む、家計の割引効用とする。
  • エピソードベースの学習を実装し、報酬収束基準(d_u^min)に基づく終了条件を設ける。エピソードは、報酬の変化がしきい値未満に下がった時点で終了する。
  • 経験再生とターゲットネットワークを用いて学習を安定化させ、確率的ポリシーによる探索を実装する。
  • 関数近似として深層ニューラルネットワークを用いることで、ポリシーまたは価値関数の特定のパラメトリック形式を仮定せずに、非パラメトリック学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習エージェントは、異なる金融および財政政策制度下において、複数の定常状態を有する定番の貨幣的DSGEモデルを解くことができるか?
  • RQ2DRLエージェントの定常状態への収束性能と、政策制度間での安定性は、アダプティブ学習エージェントと比較してどの程度優れているか?
  • RQ3DRLエージェントは、モデルの構造的方程式や運動則の事前知識なしに、最適意思決定ルールをどの程度学習できるか?
  • RQ4DRLのグローバル学習能力により、アダプティブ学習下で学習不能な定常状態解を含め、すべての可能な定常状態に到達できるか?
  • RQ5報酬収束しきい値(d_u^min)などのハイパーパrameterが、学習精度および収束速度にどのように影響するか?

主な発見

  • DRLエージェントは、テストされたあらゆる金融および財政政策制度下において、すべての定常状態解に成功して収束した。アダプティブ学習下で学習不能な解に対しても同様に有効であった。
  • PMP-AFP制度下では、報酬収束しきい値(d_u^min)を1e-7から1e-9に低下させることで、学習精度と行動収束が著しく向上した(図10参照)。
  • DRLアプローチは、ポリシーまたは予測ルールの関数形に関するパラメトリック仮定を一切必要とせず、安定した学習を達成した。
  • モデルの複雑さや政策制度の変化に対しても強靭であり、エージェントは構造的知識ではなく、相互作用を通じて最適行動を学習した。
  • DRL学習のグローバル性により、複数の均衡に収束でき、アダプティブ学習では特定の政策組み合わせ下で収束不能となる場合があるのとは対照的であった。
  • 本手法は、価値関数の学習曲線と収束指標を用いて、学習行動を定量化可能な連続的スケールの境界つき合理主義を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。