[論文レビュー] Solving Heterogeneous General Equilibrium Economic Models with Deep Reinforcement Learning
本稿では、マクロ経済学における異質的エージェント一般均衡モデルを解くための深層強化学習(DRL)フレームワークを提案する。従来の準解析的手法に起因する制限を克服し、市場清算制約のもとで時間的効用を最適化するエージェントの訓練により、確率性、異質性、動的フィードバックを伴う複雑なモデルに対し、正確で安定的かつスケーラブルな解を得た。実証例として、予防的貯蓄モデル、確率的RBCモデル、年齢別リスクと労働供給反応を内蔵する疫学的マクロパンデミックモデルを提示した。
General equilibrium macroeconomic models are a core tool used by policymakers to understand a nation's economy. They represent the economy as a collection of forward-looking actors whose behaviours combine, possibly with stochastic effects, to determine global variables (such as prices) in a dynamic equilibrium. However, standard semi-analytical techniques for solving these models make it difficult to include the important effects of heterogeneous economic actors. The COVID-19 pandemic has further highlighted the importance of heterogeneity, for example in age and sector of employment, in macroeconomic outcomes and the need for models that can more easily incorporate it. We use techniques from reinforcement learning to solve such models incorporating heterogeneous agents in a way that is simple, extensible, and computationally efficient. We demonstrate the method's accuracy and stability on a toy problem for which there is a known analytical solution, its versatility by solving a general equilibrium problem that includes global stochasticity, and its flexibility by solving a combined macroeconomic and epidemiological model to explore the economic and health implications of a pandemic. The latter successfully captures plausible economic behaviours induced by differential health risks by age.
研究の動機と目的
- 確率性および動的フィードバックの下で、異質的エージェントを伴う一般均衡モデルを解く際の準解析的手法の限界を克服すること。
- 標準的代表的エージェントモデルでは捉えきれない、パンデミックの影響、年齢別労働供給、部門の異質性といった現実的な経済現象をモデル化できること。
- 連続的選択変数とグローバル制約を伴う合理的期待一般均衡(REE)モデルを解くための計算効率が高く、拡張可能で安定したフレームワークの開発。
- グローバルな確率的ショックおよび内生的健康・経済相互作用を伴う多様なマクロ経済設定において、本手法の正確性と頑健性を実証すること。
- マクロ経済学と強化学習を統合し、不確実性下でのスケーラブルかつ前向きなエージェント行動を可能とし、政策的関心のあるシミュレーションおよび逆強化学習(inverse RL)への応用可能性を示すこと。
提案手法
- 家計および企業が予算制約および生産制約のもとで時間的効用を最適化する一般均衡モデルを、マーカフ連鎖意思決定問題として定式化する。
- 高次元で連続的な状態空間および行動空間におけるエージェントの学習を安定化させるために、深層Qネットワーク(DQN)に優先順位付き経験再生とターゲットネットワークを適用する。
- 集中型訓練と分散型実行(CTDE)アプローチを採用し、集計的エージェント行動から得られるグローバルな市場清算条件(例:価格、金利)を計算する。
- ログ自己回帰過程を用いて確率的グローバル変数(例:技術ショック)を統合し、エージェントが実現値を観測可能か否かを制御することで、ポリシー学習に影響を与える。
- オフポリシー経験再生を用いてエージェントを訓練し、複数のシミュレーションで並列に経験軌跡を収集することで、サンプル効率を向上させる。
- 価値関数の平均化と学習率の減少を適用し、ポリシー学習における収束の安定性を高め、振動を低減する。
実験結果
リサーチクエスチョン
- RQ1深層強化学習は、異質的エージェントおよび連続的選択変数を伴う合理的期待一般均衡モデルを正確に解くことができるか?
- RQ2エージェントがグローバルな確率的ショック(例:技術ショック)の実現値を観測できるかどうかが、その労働供給経路の安定性および曲率に与える影響は何か?
- RQ3DRLフレームワークは、パンデミックの動態とマクロ経済結果の間のフィードバックループといった、複雑な現実世界の相互作用をモデル化できるか?
- RQ4異なる好みおよび制約を有する異質的エージェントをモデル化する際、本手法の計算効率および収束安定性はどのようにスケーリングされるか?
- RQ5本フレームワークは、健康リスク下での予防的貯蓄および年齢別に異なる労働供給行動といった、現実的な経済行動をどの程度正確に捉えることができるか?
主な発見
- DRL手法は、既知の解析解を有するベンチマーク予防的貯蓄モデルを正確かつ安定的に解き、複数回の実行において高い正確性を達成した。
- 技術ショックの実現値を観測するエージェントは、観測しないエージェントと比較して著しく滑らかな労働供給経路を示し、平均の絶対曲率が0.44(非観測者)から0.27(観測者)に低下した。
- 疫学的マクロモデルにおいて、本フレームワークは年齢別に異なる健康リスクに対する現実的な労働供給反応を捉え、パンデミック動態に起因するマクロ経済的フィードバックを示した。
- 並列経験収集を用いることで、本手法は効果的にスケーリングされ、8スレッドを用いて約6時間で収束に到達し、合計で約100,000件の経験が得られた。
- 優先順位付き経験再生および学習率の減少の導入により、トレーニングの安定性が著しく向上し、ポリシー学習における振動が低減した。
- 本フレームワークは、グローバルな不確実性を伴う生産ショックに対しても適切に処理でき、エージェントが自己回帰的技術プロセスに動的に適応した。これは、すべてのエージェントが完全に観測可能な状況でない場合でも同様に成立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。